Pith. sign in

Paper Citation Record · LEDGER

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion

As of 20 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 3 inbound Pith citation observations for arXiv:2507.02813.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.02813 v1

Coverage vector

measured 54 of 54 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T20:26:10.731298Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-16T20:46:04.875912Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-16T20:48:32.619134Z

Reference resolution

54 of 54 outbound references displayed

  • verified exact2
  • verified fuzzy20
  • unresolved32
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 2ba00fcf-dc2a-4cd3-8009-2215fac3b0ab · outbound

This paper cites SegDiff: Image Segmentation with Diffusion Probabilistic Models.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion SegDiff: Image Segmentation with Diffusion Probabilistic Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.485250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.485250Z digest=sha256:d30f43980e318956f8af7bad23763dcf62f1923fc535179c29b0e2aa9e457166

Observation 8c24e836-1846-4fb5-84ca-e273ff01f671 · outbound

This paper cites Scanqa: 3d question answering for spatial scene understanding.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Scanqa: 3d question answering for spatial scene understanding

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.575492Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.490698Z digest=sha256:b05bcd3a1960a4f94c421ebd8b79864994038ec989f60fd78c7dfceb4abc37c3

Observation ab5176a5-be07-4a85-a416-cb99f9d3e077 · outbound

This paper cites VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.495325Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.495325Z digest=sha256:b81673e52d6488fd17d3ea1a030f48f2fbf26e3439bdfbda97ba5c55ced83fe4

Observation 702b9339-e220-486b-9577-73612a2e86c9 · outbound

This paper cites pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.501075Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.501075Z digest=sha256:8fada0875982858076ca89276b110e51519584e4abb52629648bd4fc9c2b628d

Observation 560d5a49-c128-455e-b2d4-bb520d2f5bf8 · outbound

This paper cites PGSR: Planar-based Gaussian Splatting for Efficient and High-Fidelity Surface Reconstruction.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion PGSR: Planar-based Gaussian Splatting for Efficient and High-Fidelity Surface Reconstruction

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.505304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.505304Z digest=sha256:f632eae94dbc49a8b9e0373ff2c92d9a075bd662bbdd9a5fc76bdd9989baa23b

Observation a1093ef5-d166-45b6-ab6d-b7bd09acf525 · outbound

This paper cites Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.552600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.510017Z digest=sha256:b7c4dcf230fdc950ae02a37d2d2a57d72582d25001d7406b78bf1cf340d1b96b

Observation 00bee198-6472-4cdc-8804-20acb66a67ec · outbound

This paper cites Scannet: Richly-annotated 3d reconstructions of indoor scenes.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Scannet: Richly-annotated 3d reconstructions of indoor scenes

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.539853Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.514928Z digest=sha256:35bcf8452b9761aa2a37f6d2fcfada2a15d622b10995efca0543a326025e5792

Observation a671133e-0400-477a-9b4d-37640493ebab · outbound

This paper cites Large spatial model: End-to-end unposed images to semantic 3d.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Large spatial model: End-to-end unposed images to semantic 3d

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.527302Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.519495Z digest=sha256:51afa66b42b5465b90c28f692661174fcd8ee048a22d835812ec6d4520140eca

Observation 4edcbdc5-3c37-4e1b-9211-3ea833820311 · outbound

This paper cites Random sample consensus: a paradigm for model fitting with applications to image analy- sis and automated cartography.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Random sample consensus: a paradigm for model fitting with applications to image analy- sis and automated cartography

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.514724Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.523577Z digest=sha256:d4f59a0bcf87b56918ed759dfb4a6d3ab1684becbc15aa8ce139ee00fde6b213

Observation 99e68be3-4479-4fa2-b0f3-8cf68ea5c5c5 · outbound

This paper cites Iqa: Visual question answering in interactive environments.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Iqa: Visual question answering in interactive environments

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.502255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.527780Z digest=sha256:4cde55c8a5b9b7840c6e52888f4b02309c57330b21fcc2c082ebef33d99b70e8

Observation d5701d34-484b-4d2e-bc23-6139032ad08f · outbound

This paper cites Sugar: Surface- aligned gaussian splatting for efficient 3d mesh reconstruc- tion and high-quality mesh rendering.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Sugar: Surface- aligned gaussian splatting for efficient 3d mesh reconstruc- tion and high-quality mesh rendering

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.532027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.532027Z digest=sha256:3df0a165285d2725a0b048bc31a145aa10e3733ad373fef9e05d7492ec2e429b

Observation 6c7397a1-a266-480a-a4cf-7f81a2c3d63b · outbound

This paper cites CameraCtrl: Enabling Camera Control for Text-to-Video Generation.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion CameraCtrl: Enabling Camera Control for Text-to-Video Generation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.536003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.536003Z digest=sha256:1fa17e921ab8daa6ca0885ef7edd5762a973c9b4b6cc3664a434fd7736fdb0bc

Observation ad221c26-2cd7-4a69-af52-afbb14e32f37 · outbound

This paper cites SparseLGS: Sparse View Language Embedded Gaussian Splatting.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion SparseLGS: Sparse View Language Embedded Gaussian Splatting

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-08-06T20:26:11.119535Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.540584Z digest=sha256:bdbff882c49938e383038077799dfe32b80aad24be88b524fe9f33b096b4bb3e

Observation d6dcd6a3-1953-4a52-870d-1c6e7b2fb79a · outbound

This paper cites DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.545095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.545095Z digest=sha256:e1f37d80c94f639b50ff1d4e3116dfbf297a54027525a585d18ac97ffd5c9ebb

Observation 650467ba-9673-4bbf-9730-1b30551f9038 · outbound

This paper cites 3d gaussian splatting for real-time radiance field rendering.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion 3d gaussian splatting for real-time radiance field rendering

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.480640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.549768Z digest=sha256:d4cc49e42e9d2ee015ee6de2238acec62d2ec5853af19b3a8fe3b80d4f5916e1

Observation 95fe322b-823b-4bb5-b9c7-e4940a7ca05d · outbound

This paper cites Lerf: Language embedded radiance fields.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Lerf: Language embedded radiance fields

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.558642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.558642Z digest=sha256:44d6480ddebdbe54ffb562376123147a04a63c943c50acf97a6de3fdf1da2520

Observation 33c246f3-1211-4ce6-9869-f0a9a28e170f · outbound

This paper cites Segment Anything.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Segment Anything

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.562955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.562955Z digest=sha256:dadeecc3ff2e7b41c5bbc54292a6cc2ff54649a8788777fe2a2c7e0b5e2596e1

Observation aefb78a9-159c-4af5-89af-c8c4943bbe05 · outbound

This paper cites Language-driven semantic seg- mentation.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Language-driven semantic seg- mentation

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.458186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.567968Z digest=sha256:15d9e61da9a790a735aedf6d56bf621bdc3587e9fa0d0d997262797aa6ea699d

Observation bdc9fe5c-b17d-4264-98e1-3db0c15f292f · outbound

This paper cites Langsurf: Language-embedded surface gaussians for 3d scene under- standing.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Langsurf: Language-embedded surface gaussians for 3d scene under- standing

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.572250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.572250Z digest=sha256:cf40442843b5bdcabf15b3b9c8f5bd75c69463f1d104d9a7136f7eaa58f02814

Observation 4657ebb9-27b7-49b0-8764-a76531c8dce3 · outbound

This paper cites Gp- nerf: Generalized perception nerf for context-aware 3d scene understanding.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Gp- nerf: Generalized perception nerf for context-aware 3d scene understanding

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.576980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.576980Z digest=sha256:295bf7eba381611abd2ef343ee4912a635ece308d191144c0601cfd7c67909e2

Observation ffe2ab00-0a5b-4b7d-89c1-9c7a8328c928 · outbound

This paper cites Dngaussian: Optimizing sparse-view 3d gaussian radiance fields with global-local depth normaliza- tion.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Dngaussian: Optimizing sparse-view 3d gaussian radiance fields with global-local depth normaliza- tion

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.581135Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.581135Z digest=sha256:c89389649116461879ff2e82ef06f94fbdbc268a1c1bbf1501f14189cda8ac72

Observation 879e0617-5f42-41ab-a3df-1c48a85518ca · outbound

This paper cites Microsoft coco: Common objects in context.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Microsoft coco: Common objects in context

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.419116Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.585876Z digest=sha256:9b8bc1163f390d5b7225ccb2fad4911c4dd6d167b1d8b74d102d344c138e1691

Observation 3aa9618f-d615-4f13-9ec7-1f27fad952a8 · outbound

This paper cites Infinite na- ture: Perpetual view generation of natural scenes from a sin- gle image.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Infinite na- ture: Perpetual view generation of natural scenes from a sin- gle image

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.392621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.590058Z digest=sha256:447556e27cec7e648b95a797471e1e848cc25703ea6ab7001a5900dd44aadeef

Observation 9a7b4c84-e442-446c-937a-e10205ac8651 · outbound

This paper cites Semantic ray: Learning a generalizable semantic field with cross-reprojection attention.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Semantic ray: Learning a generalizable semantic field with cross-reprojection attention

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.377059Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.594803Z digest=sha256:6ce31f6457c9113b7c7bba8542ea8fd5f30ce5ed876c9f772d798135d7e05896

Observation f5734084-3444-42ef-a038-169e0f07a17a · outbound

This paper cites ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.599197Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.599197Z digest=sha256:a5c046816c2355fb579431806b2e1759cde27c2e482cf25966f5f3408f5751a3

Observation 202a909a-fdc0-40ba-a51c-9957341dc664 · outbound

This paper cites Make-your-3d: Fast and consistent subject- driven 3d content generation.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Make-your-3d: Fast and consistent subject- driven 3d content generation

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.362417Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.603721Z digest=sha256:66d8480e99db6ff377311c185753183f8addba4eda41cf1a7dae52309c5df76b

Observation ae15fd43-e018-46a2-841f-f31d3c2af895 · outbound

This paper cites Physics3D: Learning Physical Properties of 3D Gaussians via Video Diffusion.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Physics3D: Learning Physical Properties of 3D Gaussians via Video Diffusion

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.607650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.607650Z digest=sha256:6f6e824f38605b40ef4358908cc363a31b5127cfda0d0aa6c2609fce4a40eeb7

Observation 20d2d07c-0fc2-477e-a6d9-8d80c82c699b · outbound

This paper cites Decoupled Weight Decay Regularization.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Decoupled Weight Decay Regularization

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.612591Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.612591Z digest=sha256:bd9d407e05e345ebc94e3d3573c0b903fd5812836917c246e899bdfe0326aa22

Observation 9a74b982-b103-410b-b1e7-7b8783a0203b · outbound

This paper cites Gaussian splatting slam.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Gaussian splatting slam

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.617454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.617454Z digest=sha256:eb5b9265cfe5d6db62ee532121d506f79ec87e3c3a8a30851d6284020a785cfa

Observation 6bbe1d33-99a9-4dfc-93e5-f9499cd9f715 · outbound

This paper cites Nerf: Representing scenes as neural radiance fields for view syn- thesis.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Nerf: Representing scenes as neural radiance fields for view syn- thesis

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.621535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.621535Z digest=sha256:2cb12627a033470f123b911cddfbefee2b90635b477910f1b0e18e353fd98c7f

Observation 7f6d95e9-1898-482a-9dee-928897084797 · outbound

This paper cites Sift: Predicting amino acid changes that affect protein function.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Sift: Predicting amino acid changes that affect protein function

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.331927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.625528Z digest=sha256:afec8aeda7f1a0cd2c6ab8bf574b85e4e9a1d0ce753bd676ef5a6937665b0011

Observation 78a107e8-d47d-47ee-a835-ae292b11209d · outbound

This paper cites Scalable diffusion models with transformers.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Scalable diffusion models with transformers

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.629501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.629501Z digest=sha256:4048ce4a3399d5bc73a2fbca3bf6fe9fa1ee012a573b88b3067b5fc61f1c116b

Observation 3d0c6447-2761-402d-8cf9-50107ee7c3bd · outbound

This paper cites Langsplat: 3d language gaussian splatting.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Langsplat: 3d language gaussian splatting

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.309471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.634390Z digest=sha256:c40c40ae35516e44f3953d5f533ac11fa15ca913c19b7b699aed0479acd69462

Observation 8d0f8964-70a6-430c-b7bc-df4414790a17 · outbound

This paper cites Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.295710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.638836Z digest=sha256:203e4858b6da66a614392e188fb112b4c611104def091cd21d29b1c17e26795d

Observation 0c0b20d5-7a6e-4237-861a-da58180303a0 · outbound

This paper cites Language embedded radiance fields for zero-shot task-oriented grasping.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Language embedded radiance fields for zero-shot task-oriented grasping

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.281973Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.643064Z digest=sha256:9e50df3c9d7683a73840a9e8e5d56c8368bf25c53fd724482ce0e80595af26e3

Observation 16d2046e-4f69-404c-a0a1-268129f03364 · outbound

This paper cites SAM 2: Segment Anything in Images and Videos.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion SAM 2: Segment Anything in Images and Videos

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.647263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.647263Z digest=sha256:32ed5e5bea5ce9ebe93a2269f75335a9608984d0da4bb28655211c4f056c84e0

Observation 4cfc5efb-48f3-449b-8c94-83085e319eb2 · outbound

This paper cites Scaling Properties of Diffusion Models for Perceptual Tasks.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Scaling Properties of Diffusion Models for Perceptual Tasks

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.651525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.651525Z digest=sha256:40d1f82539f7416cc8491f5e1f65edef061797877bfbc7027a88619f4784f517

Observation 4015ad1e-4e98-430a-806e-28a7774615e2 · outbound

This paper cites Robustness of Segment Anything Model (SAM) for Autonomous Driving in Adverse Weather Conditions.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Robustness of Segment Anything Model (SAM) for Autonomous Driving in Adverse Weather Conditions

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.655782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.655782Z digest=sha256:b08eed9fe73a92273abbb9f9103d66ac6ff9e689d3c5671b09abe867b759c429

Observation f796409e-3e49-47f6-be21-de314265e29b · outbound

This paper cites Learning Temporally Consistent Video Depth from Video Diffusion Priors.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Learning Temporally Consistent Video Depth from Video Diffusion Priors

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.660772Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.660772Z digest=sha256:09930915104075af1c38538386a4afce9e05a4f0a1b3e20871bc08f4008c318d

Observation 2391828b-e872-4545-a342-40bad334e217 · outbound

This paper cites DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.665816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.665816Z digest=sha256:e3d890d1c792d633c471283ddf9b03c692586539045510fed540eadebe5a1d8d

Observation 506ce214-9099-474b-a186-76021252fe87 · outbound

This paper cites Neural discrete representation learning.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Neural discrete representation learning

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.267870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.670213Z digest=sha256:4ed33cd13b9c5be3f7cce66df2b9516ba9b07a5e8e52199e93715aa8668f51b0

Observation edc2e6db-53b6-4c67-b1ca-9cefc1ca3aff · outbound

This paper cites Attention is all you need.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Attention is all you need

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.675125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.675125Z digest=sha256:9b55b56e93e82748d80535973df76d57a5c54c3512eb08b36fa82cf6d2e96d8b

Observation 5e2f1175-642d-41fd-b604-eddf3f3fd8b7 · outbound

This paper cites Sv3d: Novel multi-view syn- thesis and 3d generation from a single image using latent video diffusion.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Sv3d: Novel multi-view syn- thesis and 3d generation from a single image using latent video diffusion

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.245962Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.679594Z digest=sha256:304e06e818b9e974c51f8732a78bd7fd304c14fcf2aaa39ebc60b99849093f0f

Observation ea0e8247-a121-4b00-9931-562c30aca80b · outbound

This paper cites Dust3r: Geometric 3d vi- sion made easy.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Dust3r: Geometric 3d vi- sion made easy

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.683800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.683800Z digest=sha256:3bbbcf51ec1aaa647c1b26c8f446a3d995096be4c47108b8e2a0cf9fedc237c1

Observation 335c0d32-a83a-4248-b557-f0cc46b319fa · outbound

This paper cites OpenGaussian: Towards Point-Level 3D Gaussian-based Open Vocabulary Understanding.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion OpenGaussian: Towards Point-Level 3D Gaussian-based Open Vocabulary Understanding

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.687969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.687969Z digest=sha256:3044968f535c51004385fe7c98d2beeb01fefb546a9c9a02731ae70465047cce

Observation 6988754d-8987-4e89-955e-4b2325ccbca4 · outbound

This paper cites Dynamicrafter: Animating open-domain images with video diffusion priors.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Dynamicrafter: Animating open-domain images with video diffusion priors

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.692552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.692552Z digest=sha256:ce2cf4997d11e2ce6e333798a552ea6acad17e7e58366d2f99a8d4bb65f9b400

Observation 3661aea2-e974-441a-aff4-5e9992b1aff9 · outbound

This paper cites Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.697300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.697300Z digest=sha256:a49c2a8438075f2bdb54aa090d1e7558c4f9799ff0c481af7d5750cb4df795bf

Observation cfda3e98-8668-4489-a746-fe1a5e560a8a · outbound

This paper cites CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.702612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.702612Z digest=sha256:905581d48b662d8b8c748afb03b47065121116d4785f61fa5cf33f94d71e5d57

Observation 36c1e16e-119d-48fc-a830-aa1f94263a22 · outbound

This paper cites Stablenormal: Reducing diffusion variance for stable and sharp normal.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Stablenormal: Reducing diffusion variance for stable and sharp normal

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.214442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.707596Z digest=sha256:fa4782b0c4ff8681b8afdf63e29d53c7b0496bfa541ecb2567eb75e8acb35e75

Observation 7b7f76ba-15ce-404a-af64-b56ee5b4c24f · outbound

This paper cites Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional clip.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional clip

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.713100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.713100Z digest=sha256:df965b942fa256b949494bd47c4bbefff692ff40888dfd5efb8c6d303dfdaae9

Observation 6bb1143d-0374-4a2a-993e-ae9ffe2f5bb8 · outbound

This paper cites ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.717650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.717650Z digest=sha256:fa9d4c9bcf4057e0583321a25b18c0cfe72184d84486978ddd15f44374f763d4

Observation cfade3f6-0df7-4509-a74f-7ea0d7686a6d · outbound

This paper cites SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation

Reference 53

Resolution
verified exact
local_arxiv, observed 2026-08-06T20:26:10.789431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.722071Z digest=sha256:2ed3260931e4d874e6adba060a21f6753f78608339cec5479e5c3e2551309b7b

Observation ab10986e-163d-4366-9a8b-1d3d8ae937ef · outbound

This paper cites Motiondirector: Motion customization of text-to-video diffusion models.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Motiondirector: Motion customization of text-to-video diffusion models

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.190957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T20:26:10.726682Z digest=sha256:3b3c787613423236e6716ca4de6c2d00c2f374cdda840c9ffbfbec8972907ae2

Observation 11aac6ee-99c3-4b6e-b1ce-e88fdc2f7c32 · outbound

This paper cites Stereo Magnification: Learning View Synthesis using Multiplane Images.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Stereo Magnification: Learning View Synthesis using Multiplane Images

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.731298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.731298Z digest=sha256:76082b1025f457f3222e689153353a8234d61df08727d4ef1bdfbdf9e3c5ec8c

Pith citing papers

Observation 33d0b0fb-25af-4e02-9cc8-a9db8557c60f · inbound

FLEG: Feed-Forward Language Embedded Gaussian Splatting from Any Views via Compact Semantic Representation cites this paper.

FLEG: Feed-Forward Language Embedded Gaussian Splatting from Any Views via Compact Semantic Representation LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-16T20:48:32.622421Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-16T20:46:04.875912Z digest=sha256:a54faed6048c94272a22e6dee996b198c1aa6e1dc0d7e6ab491f3f1b73b4da14

Observation 1ddcfd7f-f597-4e2a-a764-225ff3c1203d · inbound

NG-GS: NeRF-Guided 3D Gaussian Splatting Segmentation cites this paper.

NG-GS: NeRF-Guided 3D Gaussian Splatting Segmentation LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-10T11:55:20.610305Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-10T11:53:22.566217Z digest=sha256:b12380bfff20d58b1b3693ec741408923072a14a72abdbf89841d2610d1b3a42

Observation 92ad6003-1e25-4413-bd8e-e4fdfd66ca4c · inbound

VistaBot: View-Robust Robot Manipulation via Spatiotemporal-Aware View Synthesis cites this paper.

VistaBot: View-Robust Robot Manipulation via Spatiotemporal-Aware View Synthesis LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-11T14:41:13.785497Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-09T21:18:12.192842Z digest=sha256:03f3dd51899ca8d5e60b517db877f57c9da2edffd3f2cccef0eeaade4c9105a2