Pith. sign in

Paper Citation Record · LEDGER

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

As of 19 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 5 inbound Pith citation observations for arXiv:2507.00886.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.00886 v1

Coverage vector

measured 56 of 56 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T21:11:41.568355Z

measured 61 of 61 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T10:49:46.879382Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-21T17:10:25.176606Z

Reference resolution

56 of 56 outbound references displayed

  • verified exact0
  • verified fuzzy40
  • unresolved16
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation dce48ee3-72fe-4174-bb03-8dda3ca37c9c · outbound

This paper cites an unresolved cited work.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:11:42.769747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.213492Z digest=sha256:6308152f53258fb5c566b5c41c900c2642f18c955cc61a654bd61d4fb00f1d5a

Observation 62b8e6e7-efdf-4bbd-b2c9-46f03abdc469 · outbound

This paper cites Spice: Semantic propositional image caption evaluation.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Spice: Semantic propositional image caption evaluation

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.753837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.219518Z digest=sha256:ba448566620155ecb9856436c2c7ed6f7347547bbf4e63235e17ac6811e24339

Observation 7345b4a3-45b0-46f8-802c-2a20cb98c5c5 · outbound

This paper cites Scanqa: 3d question answering for spatial scene understanding.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Scanqa: 3d question answering for spatial scene understanding

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.735195Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.225763Z digest=sha256:004501171d5addaa6be3dd7cb08b55d97d28d1ea4dc71186a2b2018ffb99a9ab

Observation 63977d52-5bb8-497e-af86-33f3fba9f4a6 · outbound

This paper cites Meteor: An automatic metric for mt evaluation with improved correlation with human judgments.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Meteor: An automatic metric for mt evaluation with improved correlation with human judgments

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.717535Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.231148Z digest=sha256:f97e9c6bfaa1c6de3706c027585e91c0eec63fd2fa631b3956327a015f16e9a9

Observation fb36ee04-3b55-4ebc-a842-1b153aa26830 · outbound

This paper cites $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.236634Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.236634Z digest=sha256:57a4322a6721d136fc97a9c1ac0e7e2bff9f4d3f5ffabf5ec1a4052dcf2c0290

Observation 13f21252-f815-425b-8616-7b3393f11190 · outbound

This paper cites Language models are few-shot learners.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Language models are few-shot learners

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.697395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.243336Z digest=sha256:c309985226d435e3cf369f124fb90a3862acfde54a4c42c3b16f7725ca221b0b

Observation 938ebc67-bb16-43c6-92a2-f630aa023d6a · outbound

This paper cites Language models are few-shot learners.NeurIPS, 33, 2020.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Language models are few-shot learners.NeurIPS, 33, 2020

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.679435Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.249674Z digest=sha256:b6ced77166d4946fad18efc4897787c4728f3968b8ed42876a2e916b1310b49e

Observation 76d5bb44-0d64-418a-86bc-5c6d05a5182c · outbound

This paper cites Scanrefer: 3d object localization in rgb-d scans using natural language.ECCV, 2020.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Scanrefer: 3d object localization in rgb-d scans using natural language.ECCV, 2020

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.659786Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.255992Z digest=sha256:4ece491c401ffb3fb9d83e2b2797bf789f20868f53a6d0275234786f511043d3

Observation 47304348-91cd-4ef2-a326-a47b8119f6e6 · outbound

This paper cites Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.638447Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.261308Z digest=sha256:389a274b69e2bae3daba7974980d000ac42876992323bc200ab841b2f15bd8e5

Observation fe9ce82c-b4e2-4712-89ae-142ba3d732c0 · outbound

This paper cites End-to-end 3d dense captioning with vote2cap-detr.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond End-to-end 3d dense captioning with vote2cap-detr

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.617962Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.267207Z digest=sha256:dc1297a31af1c10cb44334378115c4ca0d62e0abed213c5f18885d8a295ce5dd

Observation 5928badd-048a-4be5-bdec-2c371d8eddf5 · outbound

This paper cites Grounded 3D-LLM with Referent Tokens.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Grounded 3D-LLM with Referent Tokens

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.273790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.273790Z digest=sha256:93409f76332b006ae68263ee4ae2642181bbf784c0e080a63f1cf78be4b3cfbb

Observation ece94938-dc4b-4c4e-89b9-0e712b158100 · outbound

This paper cites Scan2cap: Context-aware dense captioning in rgb-d scans.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Scan2cap: Context-aware dense captioning in rgb-d scans

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.597750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.279380Z digest=sha256:69634d8289b3a8c98458462bb85b082429a96f962399f660ce4c69546160a6a0

Observation 6f6573d0-446f-477c-b46b-aae6a6e9aad2 · outbound

This paper cites Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.579173Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.285356Z digest=sha256:bbe8f3428d003073ee3fca6e57d448022a2bba9aa74f288a3934fadce050d0b1

Observation 6b3e5da4-443a-404e-a6b8-04ed9476a780 · outbound

This paper cites Rouge: A package for automatic evaluation of summaries.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Rouge: A package for automatic evaluation of summaries

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.561846Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.293538Z digest=sha256:629b180a703612606cea73bb2889a847bed5e728b8a78d60531fe50d606f1931

Observation b5621d6d-b740-4be6-9474-c0eeb9c74ea0 · outbound

This paper cites Scannet: Richly-annotated 3d reconstructions of indoor scenes.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Scannet: Richly-annotated 3d reconstructions of indoor scenes

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.299459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.299459Z digest=sha256:03b714c599ac4f81d42772ae36b8229cc235f394b595d17ef8d572b571a7e7ae

Observation 1bc32700-92e8-43ff-8734-bd62b9a88cf2 · outbound

This paper cites Embodied question answering.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Embodied question answering

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.532399Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.305870Z digest=sha256:c7911411d1a3ba5b488d75755ea4e11447a84d6240f154754a931b90102a1ee4

Observation e07ac790-46a6-4e77-ac8e-1e736886849e · outbound

This paper cites SceneFun3D: Fine-Grained Functionality and Affordance Understanding in 3D Scenes.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond SceneFun3D: Fine-Grained Functionality and Affordance Understanding in 3D Scenes

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.510265Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.311181Z digest=sha256:6a30a872e56ed4ccd4662da411e1314d6994a88f78c436b591c0c78d307bc5f9

Observation ef2b0ee1-703c-4e38-9f4a-9f9b863e2498 · outbound

This paper cites Scene- llm: Extending language model for 3d visual reasoning.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Scene- llm: Extending language model for 3d visual reasoning

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.491273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.316170Z digest=sha256:d7e566f50c2974f7f48960c7e0e2da8bed33df71f77c022e57023a48f933a59b

Observation 9544d30b-4cbb-40ce-85a4-d77c5feccaa2 · outbound

This paper cites Perla: Perceptive 3d language assistant.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Perla: Perceptive 3d language assistant

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.471471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.320887Z digest=sha256:1f09e280031defbc5026e450e0a40c7d46810248ce452878c293f3e156635ddc

Observation 5c77d981-2f04-439c-bbce-603aafd41b13 · outbound

This paper cites 3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond 3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.312306Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.325975Z digest=sha256:2879aa5818f232c3db6222a02ce7c01240cde8de97d3fc1bbfaa57ef4dd26756

Observation 630f55f1-fbec-4517-b1a3-fbe858d17414 · outbound

This paper cites Lora: Low-rank adaptation of large language models.ICLR, 1(2), 2022.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Lora: Low-rank adaptation of large language models.ICLR, 1(2), 2022

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.292219Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.331246Z digest=sha256:1c1e79616a178d1a67d542a2637c4369db0893e65db639ebee205c147bfb3dad

Observation f23b6634-9732-42de-a357-9d2f251845f4 · outbound

This paper cites Chat-scene: Bridging 3d scene and large language models with object identifiers.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Chat-scene: Bridging 3d scene and large language models with object identifiers

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.271592Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.336827Z digest=sha256:cd56832391e52a09152a726bef59cbf86c3b4f9f9ecc1f7bc6373beee0f0413a

Observation fb659d84-9e73-4fad-92b7-a75ccb24b7e3 · outbound

This paper cites An embodied generalist agent in 3d world.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond An embodied generalist agent in 3d world

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.252342Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.343406Z digest=sha256:df426caf0e55b4df310bc57d7e4530cb32bef260b220da8749e234c424d35866

Observation 1b6958b3-d123-4be1-855f-265e1d28ba07 · outbound

This paper cites Less is more: Clipbert for video-and-language learning via sparse sampling.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Less is more: Clipbert for video-and-language learning via sparse sampling

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.233951Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.349918Z digest=sha256:f4ed04f41ff9fec57072037b12c946cfa533e665e0fc401dd168f5e5f5c770d8

Observation f6a37ab2-ae31-4632-97ba-2e40621a4375 · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.359433Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.359433Z digest=sha256:8da1eb9a9b26bc88d971c66c53d89056a9acfd9cd85e3aca5fbeaf1c100ef7bf

Observation bee4ddeb-8720-473d-b8a2-b0134860b0de · outbound

This paper cites M3dbench: Towards omni 3d assistant with interleaved multi-modal instructions.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond M3dbench: Towards omni 3d assistant with interleaved multi-modal instructions

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.201418Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.366259Z digest=sha256:f72f7a798312e5b3ab6f1e1280146022a4159639617a109487bc497190cefd0d

Observation cab475ff-1491-4357-bb41-e7d10d80fc1a · outbound

This paper cites SceneSplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond SceneSplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.372451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.372451Z digest=sha256:cd1dcec62234e2d177c76b20effbd9bf3afb029802daa668543db2aff2bbaee5

Observation ede946ef-01c0-4c02-b54a-5fb3e29f890a · outbound

This paper cites Visual instruction tuning.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Visual instruction tuning

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.180884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.378323Z digest=sha256:7b49251b6c6fd058896dd167633703c7371737910218e2e36aa95ebd86eb4126

Observation 724f85b0-b6d3-4c1f-9cc7-f69445974593 · outbound

This paper cites Robomp 2: A robotic multimodal perception-planning framework with mutlimodal large language models.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Robomp 2: A robotic multimodal perception-planning framework with mutlimodal large language models

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.162291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.383839Z digest=sha256:2c44f662447a6739a7c2d4c57ff11c4d3481699f37b12d06985fa4b357e26873

Observation 5066d224-b78d-4b15-b019-0b5bee7fc1f6 · outbound

This paper cites Sqa3d: Situated question answering in 3d scenes.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Sqa3d: Situated question answering in 3d scenes

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.144252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.394318Z digest=sha256:85c7850d111f3e0959602aeac6b023be96d9eb3d1416d4713472df5316b791a8

Observation e5e51994-6877-48f5-9e18-e05552774e67 · outbound

This paper cites Situational awareness matters in 3d vision language reasoning.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Situational awareness matters in 3d vision language reasoning

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.124429Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.402260Z digest=sha256:acfccd4642cedd35f27459555ab91a8dd81548550d47c49322f5a9428a358ec9

Observation fc7af682-c423-4ae7-a067-232cceb64d2e · outbound

This paper cites Bleu: a method for automatic evaluation of machine translation.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Bleu: a method for automatic evaluation of machine translation

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.107208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.408755Z digest=sha256:8609fae49664f3d399a79f3748769f692a0555fedb28ff60b386a2130480fd81

Observation 520415f3-da78-419e-afde-e6821d753227 · outbound

This paper cites Openscene: 3d scene understanding with open vocabularies.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Openscene: 3d scene understanding with open vocabularies

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.414354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.414354Z digest=sha256:3e141b022e11184929649d84b6e65bbbbb858166eff88127339e6254eccc143f

Observation f9a149be-8300-4397-ae53-08ed8e1386ce · outbound

This paper cites Learning transferable visual models from natural language supervision.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Learning transferable visual models from natural language supervision

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.078273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.419457Z digest=sha256:5e49aa45f8fe3c394c6d9596aa679d2690c88ddc0de7585fa20b65df6edab975

Observation 438b0917-0e25-42a8-a935-22ef8c85c414 · outbound

This paper cites Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of Machine Learning Research, 21(140), 2020.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of Machine Learning Research, 21(140), 2020

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.061024Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.424588Z digest=sha256:69dc838ce334b3acc607fc034fd8264421874298268438f1c7479e3fca67cdfc

Observation 71fa2693-091e-4163-bbe7-59e4e9eef479 · outbound

This paper cites Sayplan: Grounding large language models using 3d scene graphs for scalable task planning.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Sayplan: Grounding large language models using 3d scene graphs for scalable task planning

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.045045Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.429612Z digest=sha256:d6401dba69cfbf1c30c574ba4178d504409250a94ef87c3db142319fea20886e

Observation ca57a215-ab1f-4e44-a3a3-87d767deba3f · outbound

This paper cites Sentence-BERT: Sentence embed- dings using Siamese BERT-networks.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Sentence-BERT: Sentence embed- dings using Siamese BERT-networks

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.028525Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.435332Z digest=sha256:baba63b6f43aa88e6d60840503c588f84dd38b3d64fdd7cc701b085c8cbc9e77

Observation ef392936-ef1a-48bd-9d4f-ae7f2987b106 · outbound

This paper cites Structure-from- motion revisited.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Structure-from- motion revisited

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.010366Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.441959Z digest=sha256:c11d4a4420d7579517f65d3c80185b5ad49d6b44df53b85d35572632a8047d23

Observation fc9d63c4-4a88-49e3-b8be-6d0aec5795b4 · outbound

This paper cites Pixelwise view selection for unstructured multi-view stereo.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Pixelwise view selection for unstructured multi-view stereo

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.990655Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.447545Z digest=sha256:f7b83fde7ae0b571fc42c1eb38eb31def5c4d180b35741d6d2999bbbff7351d0

Observation ad03dfc2-3f01-4d59-9498-a50e8c5933ee · outbound

This paper cites Splat-mover: Multi-stage, open-vocabulary robotic manipulation via editable gaussian splatting.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Splat-mover: Multi-stage, open-vocabulary robotic manipulation via editable gaussian splatting

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.972997Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.455862Z digest=sha256:0235ffda9ddcbe01e78189e6670b59b6a4195408495aae5872ac16cbc919edcb

Observation 8e019016-dff5-43f2-97e2-b140d1b7666e · outbound

This paper cites Habitat 2.0: Training home assistants to rearrange their habitat.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Habitat 2.0: Training home assistants to rearrange their habitat

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.953780Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.463816Z digest=sha256:2022256cb777935ca96905abfefcd1cf8192ff8901d25fb504b0ad7960f15bc0

Observation 6dfa22b6-948a-417c-830f-1e1ad4564e8c · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.471296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.471296Z digest=sha256:30990af7bd2f4a4373b8bb9273cfe14dc6dfd68f2aa0beb15da87a182e517648

Observation a2a34dc7-ff9e-4ee3-990d-5e24b3f707a1 · outbound

This paper cites SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.478020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.478020Z digest=sha256:2da159d83cb2d5d23707106ceb0362ab302fa5f272cc9b66987bf850ed8f72b7

Observation eb9e799b-df73-4312-b8f3-a83af7481982 · outbound

This paper cites Cider: Consensus-based image description evaluation.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Cider: Consensus-based image description evaluation

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.935715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.485329Z digest=sha256:00cd7912263eed8d5393ac329ffe0098fbac3b670f933cbf05f158af02c5e88c

Observation d2f5a8ba-a8e4-4895-8388-3b4f1e16a624 · outbound

This paper cites Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes, 2023.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes, 2023

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.916290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.495612Z digest=sha256:42fb34ae9c8f47dc666a797d5fc4155c2aa3e1ef9acbbf32eaa5bb5f1338bfad

Observation 7467322e-e05c-4dc6-8602-88dd22716ae1 · outbound

This paper cites Embodied question answering in photorealistic environments with point cloud perception.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Embodied question answering in photorealistic environments with point cloud perception

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.894413Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.502387Z digest=sha256:7c4aee7b3196f32c450571822ed9e73f2438d9413b09cdf37eaa5613c0e8f74c

Observation 5821b62b-36f7-475b-a2c8-8f516a4957ac · outbound

This paper cites Tidybot: Personalized robot assistance with large language models.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Tidybot: Personalized robot assistance with large language models

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.875390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.509927Z digest=sha256:2764332e4fd0d70425654d2684171b328f13b6ea6a5e004f58f8534c5eb18b73

Observation 082210d5-5156-446f-846e-b2e69e8d03a2 · outbound

This paper cites 3D Vision and Language Pretraining with Large-Scale Synthetic Data.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond 3D Vision and Language Pretraining with Large-Scale Synthetic Data

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.518057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.518057Z digest=sha256:024218d2a297714524238f8fe18f4066c3a2bfd70b657b7244fd02793f70f4a4

Observation 9b9e34a3-bae8-453e-8ca3-30f12c17e50b · outbound

This paper cites Scannet++: A high-fidelity dataset of 3d indoor scenes.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Scannet++: A high-fidelity dataset of 3d indoor scenes

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.524888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.524888Z digest=sha256:a2c0b4e6b104863bf1b6b7d29182fcf6e76eae2c43fa65ea284c8c583da783ac

Observation 7d7b2030-b090-4bd6-9119-af0a1bebda9f · outbound

This paper cites Deep modular co-attention networks for visual question answering.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Deep modular co-attention networks for visual question answering

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.530797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.530797Z digest=sha256:2d25f20a3ab932d3eafbef630abceb5d1b76f76fbfa4296057067fab96577b3c

Observation 392a3eda-69b0-437a-934f-f03aabed6c19 · outbound

This paper cites Sigmoid loss for language image pre-training.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Sigmoid loss for language image pre-training

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.536825Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.536825Z digest=sha256:7b4b5bb059e6b1ab3665d095fa7affbe63b93c484a3cf7aee276f0c10603bbe9

Observation 1b9bf275-139b-4dd7-94bb-40a60bd0d958 · outbound

This paper cites OPT: Open Pre-trained Transformer Language Models.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond OPT: Open Pre-trained Transformer Language Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.543075Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.543075Z digest=sha256:3d3292afad3e55e946f5e11aefeddc590d848c97b71732bd895acf9def5b6c91

Observation 9ce69592-f7d9-440f-84b4-907a3b850874 · outbound

This paper cites SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.548733Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.548733Z digest=sha256:410f6c7938041c9f40ae13e430fc9046eb9d4c03707e73f76212c26f17953079

Observation 5587a349-bc45-4921-9800-e501f3c2a3f7 · outbound

This paper cites LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.554989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.554989Z digest=sha256:5c8c577628417b53b0afcd9ded9830b7498b74fa426ea7e53af81d93aa8fddfb

Observation 563e7a67-45a9-4d5b-ab49-1aafb27fae0f · outbound

This paper cites 3d-vista: Pre-trained transformer for 3d vision and text alignment.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond 3d-vista: Pre-trained transformer for 3d vision and text alignment

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.810640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.560840Z digest=sha256:cc5765b3e05314c174178e897e9ab97169eee60e526e11f5688e33d2bdf9763d

Observation 6640cf24-8cb2-4049-83d1-940a79869b70 · outbound

This paper cites How many.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond How many

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.789956Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T21:11:41.568355Z digest=sha256:820ad8b33a8c162b55c593b4d7c420387c3032fa33f9cbd6cbbe732364912855

Pith citing papers

Observation 7e82155e-5898-499c-9fd8-871245e418e0 · inbound

3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding cites this paper.

3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T10:49:46.879382Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T10:49:46.879382Z digest=sha256:04bc7f454bccb1936813fbd1a2d3ce36e4756a9e790d42a8b95621dcdce23427

Observation 941fcaf6-8663-445f-965e-9853f84b77fd · inbound

Nav-R1: Reasoning and Navigation in Embodied Scenes cites this paper.

Nav-R1: Reasoning and Navigation in Embodied Scenes GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-04T17:31:39.119379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:31:39.119379Z digest=sha256:60402b6478c66a3aed122eb5f606022608590804c5abdcb7ee817c62452d0745

Observation f079f03d-4b14-4c66-bf24-7bbb12e19578 · inbound

Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding cites this paper.

Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-16T20:38:24.856606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-16T20:34:16.666956Z digest=sha256:5803290589dfe6500de99f4d52635b8be725d97a702269d3ce021d18fab10620

Observation 86b7e462-9ced-4beb-bd69-2583450238f1 · inbound

GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation cites this paper.

GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-21T17:10:25.178774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-21T17:06:34.398973Z digest=sha256:0b79d8cde4a77c59c981fa1edae3a96379ad470d1b533a5993c2b1b846848c54

Observation 869fa4ab-31e3-4435-aeb5-d27c8362e560 · inbound

Motion-Enabled Tomography via Gaussian Mixture Models cites this paper.

Motion-Enabled Tomography via Gaussian Mixture Models GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

Reference 61

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T00:22:53.727881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-20T00:22:19.543573Z digest=sha256:9736c4d340a63ae5b6ad6228d223d4720c5dff4c109a5374d5f74aa748236234