Pith. sign in

Paper Citation Record · LEDGER

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs

As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 2 inbound Pith citation observations for arXiv:2506.05318.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.05318 v2

Coverage vector

measured 55 of 55 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T10:25:48.557534Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-12T18:56:43.374310Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-11T10:46:01.488781Z

Reference resolution

55 of 55 outbound references displayed

  • verified exact2
  • verified fuzzy37
  • unresolved16
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 6bdcce7d-0b59-4581-bd7d-e0bd413fbd3e · outbound

This paper cites Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:58.041928Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:43.825034Z digest=sha256:70c85d60f9242c36b39bc7e8de4231f641134d4f5534441b13afd2da2eb600b3

Observation 100fc6bc-4584-4849-af90-bf20b0f5694f · outbound

This paper cites Scanqa: 3d question answering for spatial scene understanding.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Scanqa: 3d question answering for spatial scene understanding

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:57.703884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:43.893027Z digest=sha256:c786b5daf45cf9110e96d48db35772b36b1323a7156cb82bdea76433beafab53

Observation 8f7d2a4b-5066-42dd-b54e-045aae48f131 · outbound

This paper cites Scanrefer: 3d object localization in rgb-d scans using natural language.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Scanrefer: 3d object localization in rgb-d scans using natural language

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:57.444816Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:43.944631Z digest=sha256:0e5f97515b0958fe9f635ddda38278f7acb1f522879825ede5b6c28ae075a5ad

Observation bb3deee4-3811-4fa5-9fba-4664d28f59e2 · outbound

This paper cites Language conditioned spatial relation reasoning for 3d object grounding.Advances in neural information processing systems, 35:20522–20535, 2022.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Language conditioned spatial relation reasoning for 3d object grounding.Advances in neural information processing systems, 35:20522–20535, 2022

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:57.138194Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:43.984815Z digest=sha256:941035303bebf7ce6ad4c011f4b458b6ddede570ab5243131ed71196e46bc9ca

Observation 8deda4f2-318b-4b76-a7c3-b92d2c9a4db9 · outbound

This paper cites End-to-end 3d dense captioning with vote2cap-detr.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs End-to-end 3d dense captioning with vote2cap-detr

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:56.985943Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.057122Z digest=sha256:48c23ce983b5ad1d3113061c47d668233e99c98ac09ffd35bb6005938a5efe6e

Observation 041477f3-2ae1-4e60-a619-b58dd87b9c44 · outbound

This paper cites Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:56.859466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.112929Z digest=sha256:b87ecef27ac36745936733f5167399b230896dc562059198b662ec20a0cd8ef7

Observation 5cb04d7e-a3d3-40a6-8bc7-69660d140e83 · outbound

This paper cites V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(11):7331–7347, 2024.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(11):7331–7347, 2024

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:56.675993Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.146472Z digest=sha256:5814adae96738c5ce3dd4190645b333508a1a189e963f120ceffc014ddba3674

Observation cf2dd138-cdb3-4e45-8ce3-5beb2f586286 · outbound

This paper cites Grounded 3D-LLM with Referent Tokens.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Grounded 3D-LLM with Referent Tokens

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:44.197695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:44.197695Z digest=sha256:f59b746fb3cebad89896c2f701350146934a58bb6d03b2bb522d7a35579bf198

Observation 30fdcd5a-1517-4913-a1f8-052590027ef2 · outbound

This paper cites Scan2cap: Context-aware dense captioning in rgb-d scans.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Scan2cap: Context-aware dense captioning in rgb-d scans

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:56.506988Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.260044Z digest=sha256:69d28b0432d524fd40ba967c9f589879327a5c490d02411a04a5bff23a113e95

Observation b09f00b7-b29b-47c3-9230-584725cf07f2 · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:56.323773Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.303854Z digest=sha256:50e4e1bc35de4eeefad9d7e0fd73a87b07bbdd6fc6f6a73190a6dd5ac4b8eae9

Observation 82ef0af7-25ed-44b1-897b-505d4bbbee8a · outbound

This paper cites Scannet: Richly-annotated 3d reconstructions of indoor scenes.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Scannet: Richly-annotated 3d reconstructions of indoor scenes

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:56.155249Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.375288Z digest=sha256:84a4fd9b4d88639a96c5f265eb35656ad9915c838140ef96c8db9b48e1ae50f9

Observation f4da52c8-f29b-4cf7-bc32-9ff3de54291e · outbound

This paper cites InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:44.412461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:44.412461Z digest=sha256:bfa4a395d249269a2688a25d736aeec4342fbc8e81a81577f49bb04ee0ebd84c

Observation 6dcc3e57-1339-43a5-89b4-aa16ea337daa · outbound

This paper cites Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:44.471372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:44.471372Z digest=sha256:5baceed77f0d5ac9047b255eb28a37d5db118bda676d921678c36c21c49418c3

Observation bccfe3f7-61f1-463d-b7dc-a8cb42dad842 · outbound

This paper cites 3d-llm: Injecting the 3d world into large language models.Advances in Neural Information Processing Systems, 36:20482–20494, 2023.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs 3d-llm: Injecting the 3d world into large language models.Advances in Neural Information Processing Systems, 36:20482–20494, 2023

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:55.954650Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.536919Z digest=sha256:5dc7a1ed317790a820656b415cf30d422fbb820b2cea8347b76b39542e9d601f

Observation 11268861-15b5-4cb8-8c3d-6479a7bbe137 · outbound

This paper cites Chat-3d v2: Bridging 3d scene and large language models with object identifiers.CoRR, 2023.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Chat-3d v2: Bridging 3d scene and large language models with object identifiers.CoRR, 2023

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:55.762030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.588379Z digest=sha256:006dd5b24a1cd8d4c31ba6311078c58dc673a34e0f44dbe5a68c73d6ea1f7e15

Observation 1ffbeb72-5633-4309-a665-f5ac60618414 · outbound

This paper cites An Embodied Generalist Agent in 3D World.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs An Embodied Generalist Agent in 3D World

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:44.641349Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:44.641349Z digest=sha256:d603d313cde71026872bb76182ab5aa76e99b70bb52afb9f055414828397b933

Observation 010ccd29-85dd-41c1-b224-e0d71ea926d9 · outbound

This paper cites Clip2point: Transfer clip to point cloud classification with image-depth pre-training.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Clip2point: Transfer clip to point cloud classification with image-depth pre-training

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:55.571576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.695833Z digest=sha256:33dcb8a97759ae080a9806f6d2c8278fd4f07ab51528612e9e9cbd0d01a70441

Observation ce662654-1fb8-4b90-954d-4814eb2b5d09 · outbound

This paper cites EPCL: Frozen CLIP Transformer is An Efficient Point Cloud Encoder.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs EPCL: Frozen CLIP Transformer is An Efficient Point Cloud Encoder

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-08-07T10:25:49.741416Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.757938Z digest=sha256:f3d9fc2ab9616095687b422bb7299019b9b601603d3d8a1eb0716f5509aa2676

Observation 47142fba-bd28-448d-9d75-888df2427826 · outbound

This paper cites Pointgroup: Dual-set point grouping for 3d instance segmentation.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Pointgroup: Dual-set point grouping for 3d instance segmentation

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:55.345276Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.792848Z digest=sha256:8db43c813ad3f1f2d6082a2feca8e9cb7ae9a61b4fe20f13e1c19d44000aa175

Observation da47fbf2-09d1-41ea-959e-3625e160701c · outbound

This paper cites UniGS: Unified Language-Image-3D Pretraining with Gaussian Splatting.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs UniGS: Unified Language-Image-3D Pretraining with Gaussian Splatting

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-08-07T10:25:49.294714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.844043Z digest=sha256:88ccb5971a62e983b5176c5638d58b579e85e19a148aa8f33b16cd85830de213

Observation f4f92c8f-8fc5-44cf-9551-5a63b714e995 · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:55.151557Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.881734Z digest=sha256:3627384d08b326c2f8d77b07ca85f214e94c59698e5c622833e2981b72475ddc

Observation 06a4d3a4-83f8-4397-b289-01023e0bfbc5 · outbound

This paper cites 3dmit: 3d multi-modal instruction tuning for scene understanding.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs 3dmit: 3d multi-modal instruction tuning for scene understanding

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:54.928381Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.918609Z digest=sha256:245e06958cc30289193a1541e8e389138995811af33e51d2f5fafd47c15556e9

Observation 32568edd-6148-4a88-a6f9-17591953b7ef · outbound

This paper cites Rouge: A package for automatic evaluation of summaries.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Rouge: A package for automatic evaluation of summaries

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:54.710935Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:44.983268Z digest=sha256:d639911795f2d2e8ece79ae6639f3d7aecf42da9943e36f8f264cdf450a8b5a4

Observation 62e534d6-3bdc-43e4-8224-e3c23053b65f · outbound

This paper cites DeepSeek-V3 Technical Report.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs DeepSeek-V3 Technical Report

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:45.062126Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:45.062126Z digest=sha256:e57163a6fcceab231477037173b5801208fa89015e11b5e86b0b3a3bfab73b8f

Observation 399c8d97-cceb-4736-811f-4353f632abfe · outbound

This paper cites Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:54.253150Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:45.129747Z digest=sha256:4636640989b1b68973c6b9f94d0ee850f28b8425e612945c9d8cc8bd83cfe597

Observation 0afcfae9-9c24-4e28-88c5-92b07520c2a7 · outbound

This paper cites Openshape: Scaling up 3d shape representation towards open-world understanding.Advances in neural information processing systems, 36:44860–44879, 2023.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Openshape: Scaling up 3d shape representation towards open-world understanding.Advances in neural information processing systems, 36:44860–44879, 2023

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:53.994244Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:45.214919Z digest=sha256:a8c6b75de3e24fa8afe6bcd00f4d269b3f44a8dfde54e7cbb504d59dddc59a80

Observation b5709a7f-17aa-45f9-b753-dd1ce3348b3c · outbound

This paper cites Decoupled Weight Decay Regularization.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Decoupled Weight Decay Regularization

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:45.301176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:45.301176Z digest=sha256:e482e340eee68ad32c5a04cd838930c3cfe86f2fb061dc20b34799b36f59ebfc

Observation fd4dec3b-1a3b-4b5f-b142-d4d15b470c63 · outbound

This paper cites SQA3D: Situated Question Answering in 3D Scenes.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs SQA3D: Situated Question Answering in 3D Scenes

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:45.371810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:45.371810Z digest=sha256:100ac904811ec8bcd2fc591c014c070abfc3ede46c7eed8c8d146ce3aada6cd1

Observation f8bb490b-426c-4d49-91f5-07d3e3abf549 · outbound

This paper cites Image caption generation using vision transformer and gpt architecture.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Image caption generation using vision transformer and gpt architecture

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:53.742079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:45.453544Z digest=sha256:f5fabfa51e5e1055ba0ac5ea34fe7ebb95a1205d6af663341e5b260e08a7a42f

Observation 769730cb-d3d3-4aa4-a850-281de509c935 · outbound

This paper cites An end-to-end transformer model for 3d object detection.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs An end-to-end transformer model for 3d object detection

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:53.533453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:45.519598Z digest=sha256:5816d3e0ce3830b0a073bc3424f077c3a1e7346e534502e05ae88767c7954bad

Observation 2bfb3ae7-65b9-4250-8d73-eddabd07daad · outbound

This paper cites Bleu: a method for automatic evaluation of machine translation.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Bleu: a method for automatic evaluation of machine translation

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:53.333859Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:45.639278Z digest=sha256:8f1739438d83cc6731a27bb5ad135ba7801e072d4547143c524dbce32048f975

Observation b1e9ef53-b409-4ca9-8f1c-77dbf5b48b3c · outbound

This paper cites Pointnet++: Deep hierarchical feature learning on point sets in a metric space.Advances in neural information processing systems, 30, 2017.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Pointnet++: Deep hierarchical feature learning on point sets in a metric space.Advances in neural information processing systems, 30, 2017

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:45.755039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:45.755039Z digest=sha256:e6d80bb0749abcbd29050293037639ce0b2d74cabba90091b83c7071d2930b35

Observation 3fe6de52-0245-4260-8ada-a0899b626538 · outbound

This paper cites Deep hough voting for 3d object detection in point clouds.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Deep hough voting for 3d object detection in point clouds

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:53.103031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:45.852622Z digest=sha256:19f9d4c25951243ee8808745efd1c1deb0fd223c8f5bd9288d4bb013b6998435

Observation 23d4407d-e036-4616-8166-7cea9b9c1fd6 · outbound

This paper cites Minigpt-3d: Efficiently aligning 3d point clouds with large language models using 2d priors.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Minigpt-3d: Efficiently aligning 3d point clouds with large language models using 2d priors

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:52.859702Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:46.010018Z digest=sha256:2ba4ac97e48211ad50c41afb87d986ea499f83d200e8ddfeaca7f9a6b2ed018f

Observation 58c4ca19-8cce-43af-8c86-ce2b07162d9c · outbound

This paper cites Exploring the potential of encoder-free architectures in 3d lmms.arXiv preprint arXiv:2502.09620, 2025.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Exploring the potential of encoder-free architectures in 3d lmms.arXiv preprint arXiv:2502.09620, 2025

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:46.116105Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:46.116105Z digest=sha256:972a34204b4983c806962ee48a68a3a4abd5e089f837540e51d04e6cf2ed0143

Observation fe3eadfa-8ce1-46d7-8376-4faa6ecd7b70 · outbound

This paper cites More text, less point: Towards 3d data-efficient point-language understanding.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs More text, less point: Towards 3d data-efficient point-language understanding

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:52.619439Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:46.275521Z digest=sha256:016aaa07ef81511455dbfef1a8c459d764d2a7330359b8e13e0603149d141f17

Observation 28f0aee3-b652-4e60-bcc8-976d1a5e2264 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Gemini: A Family of Highly Capable Multimodal Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:46.374821Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:46.374821Z digest=sha256:ad9c2b2a6861bb2fb729a635b1e9bca08cde5475445907fd319f27f3e305e358

Observation 8198f18e-47c9-4afa-9541-947ba2f1388d · outbound

This paper cites Consensus-based image description evaluation.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Consensus-based image description evaluation

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:52.400284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:46.482854Z digest=sha256:af7813631e4bc0e71f0814f97abbe246496943acbcdfc959597157239a2bb7c0

Observation 5dc01e8f-1205-4a86-b19b-341ee28b23ab · outbound

This paper cites Rio: 3d object instance re-localization in changing indoor environments.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Rio: 3d object instance re-localization in changing indoor environments

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:52.165563Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:46.591830Z digest=sha256:4b39f168afa3662d0c2fbf7f5ef852cbd3eb032840ad41f94cbb05da6d1a1b7c

Observation 1e8912ea-486e-4f5b-a969-fb59ab188393 · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:46.735483Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:46.735483Z digest=sha256:32b24e0395563e7ab59926cc5b8c1c92d0da842d6567f07c3f0f8c762d5084fd

Observation 4104cf64-9a79-479a-8a95-aa966c494b5f · outbound

This paper cites Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:46.891351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:46.891351Z digest=sha256:d5a1bfa26c95529b206e29f445cf2355b75daec0a083972a40197db6fcca6914

Observation c99e5d3e-9146-45d0-978a-a07c0c56dba5 · outbound

This paper cites Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks.Advances in Neural Information Processing Systems, 37:69925–69975,.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks.Advances in Neural Information Processing Systems, 37:69925–69975,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:51.991118Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:46.964425Z digest=sha256:d2ed785078d36235c1c6335f0e54eb82ad2869eaffc18d76af04d53a73d40476

Observation 5102ccf4-b033-4b76-bb48-02f6ba6a1321 · outbound

This paper cites Ulip: Learning a unified representation of language, images, and point clouds for 3d understanding.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Ulip: Learning a unified representation of language, images, and point clouds for 3d understanding

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:51.792482Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:46.987087Z digest=sha256:7fdead0a34dc5da2354afdca77230862f3e80cdf7b9be9f76d4dd314ab2d42c7

Observation 3acf0840-5ce8-4a52-9c34-604e9fe48975 · outbound

This paper cites Ulip-2: Towards scalable multimodal pre-training for 3d understanding.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Ulip-2: Towards scalable multimodal pre-training for 3d understanding

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:51.632279Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:47.111172Z digest=sha256:dc5ff7dd83969fa6de0232c54ca50133705ad5709cd3e7d507eba553977bff82

Observation 0ebbd06f-6495-4e7b-88d9-a63067152ccd · outbound

This paper cites Qwen2 technical report, 2024.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Qwen2 technical report, 2024

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:51.373759Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:47.242464Z digest=sha256:b45e0fb054fc70b34f5426eb7ef82c6424c9c33904ca9cba815fe9f16f44b9b6

Observation b22b2eed-7e5a-4d9e-a226-523fdd129e06 · outbound

This paper cites Point-bert: Pre-training 3d point cloud transformers with masked point modeling.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Point-bert: Pre-training 3d point cloud transformers with masked point modeling

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:51.115965Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:47.373128Z digest=sha256:b2f223326256403cb34fd9570545ca88ba0faba06c195df056be9cc13bd54c96

Observation 958efc78-4c13-491e-8879-b37cd0ca0d39 · outbound

This paper cites Clip2: Contrastive language-image-point pretraining from real-world point cloud data.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Clip2: Contrastive language-image-point pretraining from real-world point cloud data

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:50.804303Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:47.479784Z digest=sha256:041df82ef70ffc567d68a9f4c4cb48995057f617363d247696670652845ee9f4

Observation b5d08211-3d8a-4617-810f-467a6c6bbefc · outbound

This paper cites Pointclip: Point cloud understanding by clip.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Pointclip: Point cloud understanding by clip

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:50.573860Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:47.589247Z digest=sha256:04aae406c878ee441b1fd99de3c915bc995e688acbb9c8443a7485610eb31bcf

Observation bf31fa98-f0bf-47ed-ba37-04134f3fff41 · outbound

This paper cites Learning 3d representations from 2d pre-trained models via image-to-point masked autoencoders.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Learning 3d representations from 2d pre-trained models via image-to-point masked autoencoders

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:50.406957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:47.759632Z digest=sha256:876b3c7c1e4143f5f50d67235f7123edfc0c1c95de5a7593fa526dc8808ea026

Observation 670d8369-f6cd-4e0a-8856-002805f573d3 · outbound

This paper cites Multi3drefer: Grounding text description to multiple 3d objects.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Multi3drefer: Grounding text description to multiple 3d objects

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:50.205731Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:47.934374Z digest=sha256:604a0ad3c4e8e262b6dd9696cbacdc8e6eddb9bd9de0bd11d22faa67383e1b0d

Observation 537570de-39ae-44c7-b1c1-77720a093e87 · outbound

This paper cites LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:48.086502Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:48.086502Z digest=sha256:6e22436d9ca3dcf8fe9727790f83dff48873f4c9b8c88f2b58fce1e1dd670364

Observation eb23a157-b6c3-4836-91c4-babda4b2c36f · outbound

This paper cites Uni3D: Exploring Unified 3D Representation at Scale.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs Uni3D: Exploring Unified 3D Representation at Scale

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:48.210130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:48.210130Z digest=sha256:d4da7f150e6a2778d818d5a8700e2de783e63f123b41fe4063e2acc98ab3c9d2

Observation 264df855-651c-4abf-a942-66b432d95dc4 · outbound

This paper cites LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:48.356054Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:48.356054Z digest=sha256:debe0942921d918ff972b7a2af011fcf702c480e60c00e80202d626d57cc1eee

Observation 56e5b207-47dd-4e9f-958f-b05bc7d1e707 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T10:25:48.464649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:25:48.464649Z digest=sha256:6c0d7dcd6bc006760f49d81ed11347bef344bb63dd461ebcb1a7a504ebf9c6e0

Observation d0715743-8459-4717-899e-aec8b4b8eaa5 · outbound

This paper cites it is to the.

Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs it is to the

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:25:50.075180Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T10:25:48.557534Z digest=sha256:63e1362602e6ef8d3642dda0da750a3ae18b2a9d4533ff0d0cad5d539a100ad9

Pith citing papers

Observation eefd24f7-3dc7-4112-82dc-548b3dead336 · inbound

Robotic Manipulation is Vision-to-Geometry Mapping ($f(v) \rightarrow G$): Vision-Geometry Backbones over Language and Video Models cites this paper.

Robotic Manipulation is Vision-to-Geometry Mapping ($f(v) \rightarrow G$): Vision-Geometry Backbones over Language and Video Models Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-05-11T10:46:01.498028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-10T15:20:47.418874Z digest=sha256:70c6f66432cf25d72e96c7b775415ab48efd2f9327e4001e2c12e108d323d77c

Observation 4d9868d3-4dde-4524-a927-dbd72da50379 · inbound

CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models cites this paper.

CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-12T18:56:43.374310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T18:56:43.374310Z digest=sha256:8a0c1a2b8a12e529b06a4777c7321875629c1966e2504542567ee7d9b9daf29f