{"as_of":"2026-08-09T04:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:50791fcc739271ebff53a34c7c19727ac01048fe0184de4c702000146bd8aee7","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:11:41.568355Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:49:46.879382Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T17:10:25.176606Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00886","snapshot_observed_at":"2026-08-06T10:49:46.879382Z","title":"P.; and Gool, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23478","last_updated":"2025-07-31T11:59:06Z","snapshot_observed_at":"2026-08-07T03:56:49.161093Z","submitted_at":"2025-07-31T11:59:06Z","title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T10:49:46.879382Z"},"links":{"cited_paper":"/paper/2507.00886","citing_paper":"/paper/2507.23478"},"observation_digest":"sha256:ea23c3b478d37f6a47075c4f3edc546d54ac410261a7db4590cb367daab6c015","observation_id":"7e82155e-5898-499c-9fd8-871245e418e0","resolution":{"observed_at":"2026-08-06T10:49:46.879382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00886","snapshot_observed_at":"2026-08-04T17:31:39.119379Z","title":"Gaussianvlm: Scene-centric 3d vision-language models using language-aligned gaussian splats for embodied reasoning and beyond,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-06T23:06:21.884601Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:39.119379Z"},"links":{"cited_paper":"/paper/2507.00886","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:5e4dd23ea4bf7e2325dc7bb6cc31ec798811d242b17f4f7ea5f6b69e40bfb93c","observation_id":"941fcaf6-8663-445f-965e-9853f84b77fd","resolution":{"observed_at":"2026-08-04T17:31:39.119379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"cited_work":{"arxiv_id":"2507.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00886","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaussianvlm: Scene-centric 3d vision-language models using language- aligned gaussian splats for embodied reasoning and beyond","venue":null,"work_id":"4bd5b345-8b04-4090-b596-414a2afcc851","year":2025},"citing_paper":{"arxiv_id":"2512.17817","last_updated":"2026-05-04T21:21:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-19T17:22:35Z","title":"Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T20:34:16.666956Z"},"links":{"cited_paper":"/paper/2507.00886","citing_paper":"/paper/2512.17817"},"observation_digest":"sha256:51b3dfc90198d1c88c4798c512d98a2cbaf63e2a2c3f3064b143e0f0a556eaa1","observation_id":"f079f03d-4b14-4c66-bf24-7bbb12e19578","resolution":{"observed_at":"2026-05-16T20:38:24.856606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"cited_work":{"arxiv_id":"2507.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00886","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaussianvlm: Scene-centric 3d vision-language models using language- aligned gaussian splats for embodied reasoning and beyond","venue":null,"work_id":"4bd5b345-8b04-4090-b596-414a2afcc851","year":2025},"citing_paper":{"arxiv_id":"2512.23180","last_updated":"2026-05-16T07:53:20Z","snapshot_observed_at":"2026-08-03T04:34:56.955960Z","submitted_at":"2025-12-29T03:40:05Z","title":"GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T17:06:34.398973Z"},"links":{"cited_paper":"/paper/2507.00886","citing_paper":"/paper/2512.23180"},"observation_digest":"sha256:510181dd2ca1984bbb85a5d773a62bf3e016819f8b08a4964a3f1b670e96187b","observation_id":"86b7e462-9ced-4beb-bd69-2583450238f1","resolution":{"observed_at":"2026-05-21T17:10:25.178774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"cited_work":{"arxiv_id":"2507.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00886","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaussianvlm: Scene-centric 3d vision-language models using language- aligned gaussian splats for embodied reasoning and beyond","venue":null,"work_id":"4bd5b345-8b04-4090-b596-414a2afcc851","year":2025},"citing_paper":{"arxiv_id":"2605.18210","last_updated":"2026-05-18T10:56:00Z","snapshot_observed_at":"2026-08-03T03:48:19.194837Z","submitted_at":"2026-05-18T10:56:00Z","title":"Motion-Enabled Tomography via Gaussian Mixture Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-20T00:22:19.543573Z"},"links":{"cited_paper":"/paper/2507.00886","citing_paper":"/paper/2605.18210"},"observation_digest":"sha256:37ea9f825159963672602dfb612501d3efa874947176b77170beb1c7283436ea","observation_id":"869fa4ab-31e3-4435-aeb5-d27c8362e560","resolution":{"observed_at":"2026-05-20T00:22:53.727881Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00886/citation-record","integrity":"/paper/2507.00886/integrity","json":"/paper/2507.00886/citation-record.json","paper":"/paper/2507.00886"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.764637Z","title":null,"venue":null,"work_id":"8806e488-d6eb-47bf-91b4-c89b488c2324","year":2020},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.213492Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:9be7ba017d4d976a849ee3f93e29f89652a54f5bf5f6a24d5864d3a02cd96b64","observation_id":"dce48ee3-72fe-4174-bb03-8dda3ca37c9c","resolution":{"observed_at":"2026-08-06T21:11:42.769747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.747359Z","title":"Spice: Semantic propositional image caption evaluation","venue":null,"work_id":"9c7a659c-e96f-4f74-a8d8-756aa22ba226","year":2016},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.219518Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:429f6ca43003dac586d24b94917522be704eac976755f81ea13c8660f5fb5572","observation_id":"62b8e6e7-efdf-4bbd-b2c9-46f03abdc469","resolution":{"observed_at":"2026-08-06T21:11:42.753837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.730189Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"96a9b00a-2936-4fb5-a3a3-0f9dadebd83d","year":2022},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.225763Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:09ae5373572cdb9d6381d21a81b7369fa39a72a6f395073ad6c17470c3b47649","observation_id":"7345b4a3-45b0-46f8-802c-2a20cb98c5c5","resolution":{"observed_at":"2026-08-06T21:11:42.735195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.711541Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":"d8b3dfff-d514-43a3-90d8-e67f3132c109","year":2005},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.231148Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:09effe717c6bc69f1aa2047ae5a185629602351bf8539989e50b58ec486c8390","observation_id":"63977d52-5bb8-497e-af86-33f3fba9f4a6","resolution":{"observed_at":"2026-08-06T21:11:42.717535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T21:11:41.236634Z","title":"π0: A vision-language-action flow model for general robot control.arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.236634Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:cecf050df532f55c6581c43f5d1fb1cd26f21a57b2c5cc1adf8d9205b1ca020b","observation_id":"fb36ee04-3b55-4ebc-a842-1b153aa26830","resolution":{"observed_at":"2026-08-06T21:11:41.236634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.691930Z","title":"Language models are few-shot learners","venue":null,"work_id":"b9dc8b7e-29e0-4124-887a-4d9549fc7b9f","year":2020},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.243336Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:1b4a99ce3120f9be37fe2ba3191f117cbbc325a010413f0b7cf61b4c42b2f5ae","observation_id":"13f21252-f815-425b-8616-7b3393f11190","resolution":{"observed_at":"2026-08-06T21:11:42.697395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.673891Z","title":"Language models are few-shot learners.NeurIPS, 33, 2020","venue":null,"work_id":"411f189c-0e1d-4ef3-8f2f-246390e32c6e","year":2020},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.249674Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:cab6adcaef0c3b64bc49831143ff39fb6598fa19d2d4065884d7b8b79386925d","observation_id":"938ebc67-bb16-43c6-92a2-f630aa023d6a","resolution":{"observed_at":"2026-08-06T21:11:42.679435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.652336Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language.ECCV, 2020","venue":null,"work_id":"1bc8faa3-49f2-4b09-aec2-d223bd15b1ab","year":2020},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.255992Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:a1e677c112edb261b08169d1838493ee59ace5445d90b8fdaa4170b90c6a3736","observation_id":"76d5bb44-0d64-418a-86bc-5c6d05a5182c","resolution":{"observed_at":"2026-08-06T21:11:42.659786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.632619Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":"03e1aea4-dd4a-48c8-a243-c4508d1e0a6a","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.261308Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:470957111625937771cbc3665c04f1104a53fd50c23cbcdc2d50c2fda36d7ae4","observation_id":"47304348-91cd-4ef2-a326-a47b8119f6e6","resolution":{"observed_at":"2026-08-06T21:11:42.638447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.612227Z","title":"End-to-end 3d dense captioning with vote2cap-detr","venue":null,"work_id":"0220b076-9d09-4826-83dd-475cacfb2344","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.267207Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:6c9738fcb2ce8132bcdf03e051969b6067e315b1e7dece50d1873016e609544a","observation_id":"fe9ce82c-b4e2-4712-89ae-142ba3d732c0","resolution":{"observed_at":"2026-08-06T21:11:42.617962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-05T04:37:45.202508Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-06T21:11:41.273790Z","title":"Grounded 3d-llm with referent tokens.arXiv:2405.10370, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.273790Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:6f8311de1afed63ceffa87be31d30b2e2852a0c5fad89bcef2a5b21ebd01d365","observation_id":"5928badd-048a-4be5-bdec-2c371d8eddf5","resolution":{"observed_at":"2026-08-06T21:11:41.273790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.591906Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans","venue":null,"work_id":"7bf6a429-aa93-4256-ad9c-9f60904804dd","year":2021},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.279380Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:6d2d6be33a52e07639d8d568bb096297e20b4ee6db73686939f1dee9d3909791","observation_id":"ece94938-dc4b-4c4e-89b9-0e712b158100","resolution":{"observed_at":"2026-08-06T21:11:42.597750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.573869Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna","venue":null,"work_id":"2483c37f-6c2a-486b-9c85-49afde6e7778","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.285356Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:e3099827e46f293072ac509b435803901c06b6afe638fc5173a5f5c9432169ff","observation_id":"6f6573d0-446f-477c-b46b-aae6a6e9aad2","resolution":{"observed_at":"2026-08-06T21:11:42.579173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.556547Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"d19865fc-486f-412a-b96f-c50a805ede82","year":2004},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.293538Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:3ac11ce2fb82cc887fdf572d72ba310404d406b439d96fc14a541bc652b5e171","observation_id":"6b3e5da4-443a-404e-a6b8-04ed9476a780","resolution":{"observed_at":"2026-08-06T21:11:42.561846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.299459Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.299459Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:38a763d3907879b612b11364a803961eba00ab76ba5206eab363fea1b0912031","observation_id":"b5621d6d-b740-4be6-9474-c0eeb9c74ea0","resolution":{"observed_at":"2026-08-06T21:11:41.299459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.527021Z","title":"Embodied question answering","venue":null,"work_id":"ff3c70bc-0cdf-4989-b70a-e94ccaa98071","year":2018},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.305870Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:095e34fa0c998a5b813fa76d6ae66426d4ea4120191fed1789103fdefc2b3890","observation_id":"1bc32700-92e8-43ff-8734-bd62b9a88cf2","resolution":{"observed_at":"2026-08-06T21:11:42.532399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.504131Z","title":"SceneFun3D: Fine-Grained Functionality and Affordance Understanding in 3D Scenes","venue":null,"work_id":"7c24d98e-9fce-4258-83a5-58d936ef34ab","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.311181Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:3aadacb456ab71e4ee6210c1c9732a9e824ac22714cda1d27a9b8deba5309bb0","observation_id":"e07ac790-46a6-4e77-ac8e-1e736886849e","resolution":{"observed_at":"2026-08-06T21:11:42.510265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.485513Z","title":"Scene- llm: Extending language model for 3d visual reasoning","venue":null,"work_id":"81c0c0cb-0010-4ff7-ae73-4fdd295c155a","year":2025},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.316170Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:b14b7ee058c351ffdcbd8445d8c1506079c8fab2d50c682cfa898924739ce754","observation_id":"ef2b0ee1-703c-4e38-9f4a-9f9b863e2498","resolution":{"observed_at":"2026-08-06T21:11:42.491273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.465397Z","title":"Perla: Perceptive 3d language assistant","venue":null,"work_id":"0b71cc7a-e3a2-4f92-8c05-48787cac60e7","year":2025},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.320887Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:00d0313d97a1b620dd7552225a8a3864b9a77885a5dcad41b37317a3a7da246a","observation_id":"9544d30b-4cbb-40ce-85a4-d77c5feccaa2","resolution":{"observed_at":"2026-08-06T21:11:42.471471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.306790Z","title":"3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023","venue":null,"work_id":"ece79bc8-eb6b-4f54-8629-0049e833f0e6","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.325975Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:a2cdd1df3adee7e748a8b9be546bc24a97c4d1d39e0e9ebaf6bb2cfb188814e1","observation_id":"5c77d981-2f04-439c-bbce-603aafd41b13","resolution":{"observed_at":"2026-08-06T21:11:42.312306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.286590Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2), 2022","venue":null,"work_id":"ed6ab08b-8447-4fb3-8fe6-a37e6a572a84","year":2022},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.331246Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:ef1e59f597f88554cdad6943f723f7c8190fdafe761d1400194fabe69fa14181","observation_id":"630f55f1-fbec-4517-b1a3-fbe858d17414","resolution":{"observed_at":"2026-08-06T21:11:42.292219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.264923Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"c6ccc816-bd76-421d-b93d-7996447871c7","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.336827Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:125fa8d7e89f08448dbef6765a3e812d88b91db730c8194944d1abf84d62e058","observation_id":"f23b6634-9732-42de-a357-9d2f251845f4","resolution":{"observed_at":"2026-08-06T21:11:42.271592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.245843Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"e5d552e4-3483-411a-b343-cbac49572c9b","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.343406Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:051916433e8644adcf33f869ca13e169f38b2502d7f8eb999332c6c497461336","observation_id":"fb659d84-9e73-4fad-92b7-a75ccb24b7e3","resolution":{"observed_at":"2026-08-06T21:11:42.252342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.226966Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"510c9264-84d7-49c9-a7fc-03a6a7c74404","year":2021},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.349918Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:db423817a6661fb9125512bee2cb7f7c696c9df72feca6b543923b70bc7ed8fa","observation_id":"1b6958b3-d123-4be1-855f-265e1d28ba07","resolution":{"observed_at":"2026-08-06T21:11:42.233951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.359433Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.359433Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:717c12d3f65ff4b2c65f8031d436ff4913803f49bccc03ee9e6e4ed936809ca1","observation_id":"f6a37ab2-ae31-4632-97ba-2e40621a4375","resolution":{"observed_at":"2026-08-06T21:11:41.359433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.195683Z","title":"M3dbench: Towards omni 3d assistant with interleaved multi-modal instructions","venue":null,"work_id":"66698458-7b1c-4bca-9760-c01f25468439","year":2025},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.366259Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:0ae0d6ee935802cf090ea9821b7ab51a48af117b89e5f2092f28b448093d0efb","observation_id":"bee4ddeb-8720-473d-b8a2-b0134860b0de","resolution":{"observed_at":"2026-08-06T21:11:42.201418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18052","last_updated":"2025-06-03T16:42:52Z","snapshot_observed_at":"2026-08-07T16:43:20.609154Z","submitted_at":"2025-03-23T12:50:25Z","title":"SceneSplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18052","snapshot_observed_at":"2026-08-06T21:11:41.372451Z","title":"Scenesplat: Gaussian splatting-based scene understanding with vision- language pretraining.arXiv:2503.18052, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.372451Z"},"links":{"cited_paper":"/paper/2503.18052","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:2f195d1858ad54864d19ed4a2ef7067a1fdf1639e4abcfe99f61a8aefa4ad08b","observation_id":"cab475ff-1491-4357-bb41-e7d10d80fc1a","resolution":{"observed_at":"2026-08-06T21:11:41.372451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.175392Z","title":"Visual instruction tuning","venue":null,"work_id":"b4121e32-3108-4163-93e2-9a454111e7f8","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.378323Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:e4cfde2c978e07a29ebf682dbab4f045c4cef4c36326eef130691fb23b0b356a","observation_id":"ede946ef-01c0-4c02-b54a-5fb3e29f890a","resolution":{"observed_at":"2026-08-06T21:11:42.180884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.156540Z","title":"Robomp 2: A robotic multimodal perception-planning framework with mutlimodal large language models","venue":null,"work_id":"6468a6b7-4070-4229-b722-9296348c977d","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.383839Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:97f81289a6bdfad09c3fe4bba6aa85543d21eee641e6254deb0e7df0ac3bbab0","observation_id":"724f85b0-b6d3-4c1f-9cc7-f69445974593","resolution":{"observed_at":"2026-08-06T21:11:42.162291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.137644Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":"f48ff884-e458-4ae4-ae1a-b3a05bae97ae","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.394318Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:2880997ab51caf94eac4563eb04a29935bd599816e2919e5386f733ee3e10116","observation_id":"5066d224-b78d-4b15-b019-0b5bee7fc1f6","resolution":{"observed_at":"2026-08-06T21:11:42.144252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.118802Z","title":"Situational awareness matters in 3d vision language reasoning","venue":null,"work_id":"17a64253-0f22-46d8-a49f-8f8b6deab0be","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.402260Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:29e5d15cf97189ede4140bbd32e41ab79c7f6c009b56ffe9eadb2201cf6a2e87","observation_id":"e5e51994-6877-48f5-9e18-e05552774e67","resolution":{"observed_at":"2026-08-06T21:11:42.124429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.101784Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"ae052b35-1ed4-4652-90ed-608486dba12e","year":2002},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.408755Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:6fadf6ce30321afccb6e93e22a69db458e314c7f868383c3d0b57d4fa9bb7cc7","observation_id":"fc7af682-c423-4ae7-a067-232cceb64d2e","resolution":{"observed_at":"2026-08-06T21:11:42.107208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.414354Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.414354Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:42a95d38303242b41d422ac11859d8e227aa25176e277ee070b4bbf705b754e9","observation_id":"520415f3-da78-419e-afde-e6821d753227","resolution":{"observed_at":"2026-08-06T21:11:41.414354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.073040Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"51c60d63-7e5c-4d1c-9f94-fb07c982fbce","year":2021},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.419457Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:f7c8541edc55ed4867ae6fcce0196148c6451680b4025baf157e5c48f6fb9d09","observation_id":"f9a149be-8300-4397-ae53-08ed8e1386ce","resolution":{"observed_at":"2026-08-06T21:11:42.078273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.055556Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of Machine Learning Research, 21(140), 2020","venue":null,"work_id":"424744ef-323e-4588-a815-0b26f73b94f5","year":2020},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.424588Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:ea1c836b7ed1a3c5b6e7a1d748592bad19eddfdff9aa483052359535408d3d54","observation_id":"438b0917-0e25-42a8-a935-22ef8c85c414","resolution":{"observed_at":"2026-08-06T21:11:42.061024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.040096Z","title":"Sayplan: Grounding large language models using 3d scene graphs for scalable task planning","venue":null,"work_id":"b2d29422-34c8-4ca6-bbfa-293a1d9514f1","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.429612Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:7a04947cc0fb3812fb3cc57125742838ad798e73efd69c2a90a5257acc6e4d95","observation_id":"71fa2693-091e-4163-bbe7-59e4e9eef479","resolution":{"observed_at":"2026-08-06T21:11:42.045045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.023268Z","title":"Sentence-BERT: Sentence embed- dings using Siamese BERT-networks","venue":null,"work_id":"07a0d27e-36ce-4324-aeef-643734a42a03","year":2019},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.435332Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:ca01293a8acee7b6b72e209a0c31bbca6e70b339d80d73d6e1d8fa185bcdc6f5","observation_id":"ca57a215-ab1f-4e44-a3a3-87d767deba3f","resolution":{"observed_at":"2026-08-06T21:11:42.028525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.002966Z","title":"Structure-from- motion revisited","venue":null,"work_id":"b310126a-6a56-4316-84d3-012a3253386c","year":2016},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.441959Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:c1a33d2c9cdf4bd8f6aa060d3a427fb3b933e64ca9d345c040d9c7f7e90e3b64","observation_id":"ef392936-ef1a-48bd-9d4f-ae7f2987b106","resolution":{"observed_at":"2026-08-06T21:11:42.010366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.984903Z","title":"Pixelwise view selection for unstructured multi-view stereo","venue":null,"work_id":"70a899f2-884c-4d77-a0e6-1e815a0787a3","year":2016},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.447545Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:0e17ccab9b6d0280d684a369714db54e93f70969b2e857bbaddeb7cb340b4b03","observation_id":"fc9d63c4-4a88-49e3-b8be-6d0aec5795b4","resolution":{"observed_at":"2026-08-06T21:11:41.990655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.967036Z","title":"Splat-mover: Multi-stage, open-vocabulary robotic manipulation via editable gaussian splatting","venue":null,"work_id":"30119ed7-9b30-4c59-bb4d-54f92f6177c9","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.455862Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:7a793b7994328fc984354b458e4df10d495e780aa12f4389d7630db5f717c428","observation_id":"ad03dfc2-3f01-4d59-9498-a50e8c5933ee","resolution":{"observed_at":"2026-08-06T21:11:41.972997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.948027Z","title":"Habitat 2.0: Training home assistants to rearrange their habitat","venue":null,"work_id":"a1cbd2b5-e21d-459f-b5e1-028f9ce79aba","year":2021},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.463816Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:ab48953efecce0d9b1f6f42fcc0badc2451552ec8a3ad00a4a1c59fa68cc9177","observation_id":"8e019016-dff5-43f2-97e2-b140d1b7666e","resolution":{"observed_at":"2026-08-06T21:11:41.953780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T21:11:41.471296Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.471296Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:7ac5dbbe7247bc0b5765c5bc0f8b49ebc31de08f37ef0cd572411a828606a344","observation_id":"6dfa22b6-948a-417c-830f-1e1ad4564e8c","resolution":{"observed_at":"2026-08-06T21:11:41.471296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T21:11:41.478020Z","title":"Siglip 2: Multilingual vision- language encoders with improved semantic understanding, localization, and dense features.arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.478020Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:5146e7b73cce4b8d7a8b5dc5f5374afe23305c596a03dd3238b3964df38742ee","observation_id":"a2a34dc7-ff9e-4ee3-990d-5e24b3f707a1","resolution":{"observed_at":"2026-08-06T21:11:41.478020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.930236Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":"c3404a91-efac-4868-b4b8-0b1d3fafcf95","year":2015},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.485329Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:8298be7c7c86dfbe1124e3fe64a0180c26c91a3e71cb124ad4f926637ef22efc","observation_id":"eb9e799b-df73-4312-b8f3-a83af7481982","resolution":{"observed_at":"2026-08-06T21:11:41.935715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.909514Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes, 2023","venue":null,"work_id":"a4ce5910-24ad-4a47-8404-cb0377959719","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.495612Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:b3adccce8b7915626e6145962cfa5e894fd98e6479d5e1769ac2732b64484755","observation_id":"d2f5a8ba-a8e4-4895-8388-3b4f1e16a624","resolution":{"observed_at":"2026-08-06T21:11:41.916290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.888815Z","title":"Embodied question answering in photorealistic environments with point cloud perception","venue":null,"work_id":"4caa09d9-6296-4a35-b3a7-21a75f4b0d97","year":2019},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.502387Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:a47f8195fb55355c2d83fe03d6c874d990c17c4ea3995d484cb5acd252e50f12","observation_id":"7467322e-e05c-4dc6-8602-88dd22716ae1","resolution":{"observed_at":"2026-08-06T21:11:41.894413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.868251Z","title":"Tidybot: Personalized robot assistance with large language models","venue":null,"work_id":"d1d96d5a-04ea-4e66-8478-8fda604f3928","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.509927Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:39229b342c7830afa87db9871dc191b0a57716f1b0188cddfde41fa4269dccc1","observation_id":"5821b62b-36f7-475b-a2c8-8f516a4957ac","resolution":{"observed_at":"2026-08-06T21:11:41.875390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06084","last_updated":"2024-07-08T16:26:52Z","snapshot_observed_at":"2026-07-06T18:43:09.852565Z","submitted_at":"2024-07-08T16:26:52Z","title":"3D Vision and Language Pretraining with Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06084","snapshot_observed_at":"2026-08-06T21:11:41.518057Z","title":"3d vision and language pretraining with large-scale synthetic data.arXiv:2407.06084, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.518057Z"},"links":{"cited_paper":"/paper/2407.06084","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:11aefe1080a20daee46aefab33e23d12b21ce6189c9cdd0552c90e5d2e98bb06","observation_id":"082210d5-5156-446f-846e-b2e69e8d03a2","resolution":{"observed_at":"2026-08-06T21:11:41.518057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.524888Z","title":"Scannet++: A high-fidelity dataset of 3d indoor scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.524888Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:71ee24a3725b7b686cffb827f5f74c599efe22d83f46f26f5e2ded776df2f82b","observation_id":"9b9e34a3-bae8-453e-8ca3-30f12c17e50b","resolution":{"observed_at":"2026-08-06T21:11:41.524888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.530797Z","title":"Deep modular co-attention networks for visual question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.530797Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:643000f74352ef53c0fd4959b2c9597ac1b1044f9abdf58131ec21bc95780ba5","observation_id":"7d7b2030-b090-4bd6-9119-af0a1bebda9f","resolution":{"observed_at":"2026-08-06T21:11:41.530797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.536825Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.536825Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:b69f5b0ff23cdd10fb0ce51a4d7707b34f6b312dfc3b386681a27b899890cc49","observation_id":"392a3eda-69b0-437a-934f-f03aabed6c19","resolution":{"observed_at":"2026-08-06T21:11:41.536825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-06T21:11:41.543075Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.543075Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:60786fe3d34d784f9db44f5a5356f807eb96e9bc6059bea279a987eae1511e00","observation_id":"1b9bf275-139b-4dd7-94bb-40a60bd0d958","resolution":{"observed_at":"2026-08-06T21:11:41.543075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03878","last_updated":"2025-03-02T15:22:12Z","snapshot_observed_at":"2026-08-03T03:07:13.905747Z","submitted_at":"2024-10-04T19:22:20Z","title":"SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03878","snapshot_observed_at":"2026-08-06T21:11:41.548733Z","title":"Spartun3d: Situated spatial understanding of 3d world in large language models.arXiv:2410.03878, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.548733Z"},"links":{"cited_paper":"/paper/2410.03878","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:1b513bbaf795d10abb68654e0fcd30fdd0a68068f3f154f0c4612cb7658c8d8e","observation_id":"9ce69592-f7d9-440f-84b4-907a3b850874","resolution":{"observed_at":"2026-08-06T21:11:41.548733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-07-06T20:00:00.800207Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01292","snapshot_observed_at":"2026-08-06T21:11:41.554989Z","title":"Lscenellm: Enhancing large 3d scene understanding using adaptive visual preferences.arXiv:2412.01292, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.554989Z"},"links":{"cited_paper":"/paper/2412.01292","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:6e8c61b4ca2132dfb4f44880c9771ecee1367a3cb6419973a5cb93d95bebc132","observation_id":"5587a349-bc45-4921-9800-e501f3c2a3f7","resolution":{"observed_at":"2026-08-06T21:11:41.554989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.804411Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"bea3257a-3989-4db4-8575-1031ae7723b9","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.560840Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:b4ac82e6c557827928abc2c39b7109e7dbb493e83f654f846f2cf514e6476ab0","observation_id":"563e7a67-45a9-4d5b-ab49-1aafb27fae0f","resolution":{"observed_at":"2026-08-06T21:11:41.810640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.776726Z","title":"How many","venue":null,"work_id":"50be3415-6b33-438c-b360-2ea1667760fc","year":2025},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.568355Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:4b7c876b4afeed84f1757539cff993abcf520be58d87b58f8fef35c684c9c1eb","observation_id":"6640cf24-8cb2-4049-83d1-940a79869b70","resolution":{"observed_at":"2026-08-06T21:11:41.789956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T11:31:10.308352Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 5 inbound Pith citation observations for arXiv:2507.00886."}