{"as_of":"2026-08-14T00:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9d55ace87fb00b4e9aad14a4bdc5e54e4a79deab82e4c914e3990f24d4c917b","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:35:20.663843Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.02402/citation-record","integrity":"/paper/2412.02402/integrity","json":"/paper/2412.02402/citation-record.json","paper":"/paper/2412.02402"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.231480Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.231480Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:8ab43faa6ccf06670f79a27967a4a0d606d658b0d6cf3eec21c5961ddeefa9e1","observation_id":"66c673e3-7849-474e-94de-fca8aa8d2b86","resolution":{"observed_at":"2026-08-11T23:35:20.231480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.237165Z","title":"Localizing moments in video with natural language","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.237165Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:fe8713f0266c7779a3a8d4bf45ef90476ce888d5de7b9d7737746726d6e02a33","observation_id":"86418cd4-de27-40e3-badd-8b3a9bff1457","resolution":{"observed_at":"2026-08-11T23:35:20.237165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.242135Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.242135Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:c587860279d60bf7601f83c3ba52eafced4a7dacbc474c5b4ba21ba19ef7bc93","observation_id":"93102e63-0f06-4130-8ba7-e079449efc61","resolution":{"observed_at":"2026-08-11T23:35:20.242135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.02356","last_updated":"2021-05-28T07:09:48Z","snapshot_observed_at":"2026-08-13T23:53:49.363179Z","submitted_at":"2020-12-04T01:22:05Z","title":"WeaQA: Weak Supervision via Captions for Visual Question Answering","version":2},"cited_work":{"arxiv_id":"2012.02356","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.02356","snapshot_observed_at":"2026-08-11T23:35:21.085572Z","title":"WeaQA: Weak Supervision via Captions for Visual Question Answering","venue":"cs.CV","work_id":"cfab6d1e-26ca-48e7-b07a-b0ba00858c92","year":2020},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.246860Z"},"links":{"cited_paper":"/paper/2012.02356","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:039d42934b52898870d2d79cb3f2ed6297eea5f7c0c6ceb48a710c53e4c889e0","observation_id":"ef71f953-536f-4a36-ad73-df001c704b25","resolution":{"observed_at":"2026-08-11T23:35:21.091139Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.252192Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.252192Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:0b0ea50437d7d788ccf2d13426c4ee27ab161786fa3a9e7f52ace3f2f2fdd63a","observation_id":"3a6efffc-3544-44a3-a3dc-f0e247487913","resolution":{"observed_at":"2026-08-11T23:35:20.252192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.257074Z","title":"Language conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.257074Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:671153e3c0e251cbd9e65cf2af391c2586670907bbf9f1793a08cf343c9ede7f","observation_id":"65261456-3502-4684-a126-cbbf2bf7ae4f","resolution":{"observed_at":"2026-08-11T23:35:20.257074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.262126Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.262126Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:b311363952bc43d89dccf92b15d721753a1ee576f9890f7a6de37b7dca17f5f1","observation_id":"f2705799-0cea-40c3-87ac-b5c63327b8c6","resolution":{"observed_at":"2026-08-11T23:35:20.262126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-11T23:35:20.266674Z","title":"Bert: Pre-training of deep bidirec- tional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.266674Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:299d178513533a9c74c5f5d7452a97f57dfa01175e8ef089a6308de6c1e776f2","observation_id":"c55aecd9-e080-4c3b-a533-938c503cb105","resolution":{"observed_at":"2026-08-11T23:35:20.266674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11747","last_updated":"2020-06-27T08:19:35Z","snapshot_observed_at":"2026-08-13T22:22:01.025117Z","submitted_at":"2020-06-21T09:25:28Z","title":"Weak Supervision and Referring Attention for Temporal-Textual Association Learning","version":2},"cited_work":{"arxiv_id":"2006.11747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.11747","snapshot_observed_at":"2026-08-11T23:35:21.046980Z","title":"Weak Supervision and Referring Attention for Temporal-Textual Association Learning","venue":"cs.CV","work_id":"61431448-c3f6-404d-b66d-735b0ea72dd3","year":2020},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.271471Z"},"links":{"cited_paper":"/paper/2006.11747","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:8f97c8606c121d9179fe5fef79e2bff8f559086bbbec439046ce2e7866c08451","observation_id":"64fdb21e-e3e2-408e-828f-efe4e26819f7","resolution":{"observed_at":"2026-08-11T23:35:21.052476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.276661Z","title":"Video-of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.276661Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:220adb8eeeaf5a5f466f5d19a4fd3e9cf7de1fb49586bce9e8dbc72119ab129c","observation_id":"0b181c94-4aff-4b1e-9827-09d26aee646c","resolution":{"observed_at":"2026-08-11T23:35:20.276661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.281463Z","title":"Vitron: A unified pixel-level vision llm for understanding, generating, segmenting, editing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.281463Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:dd5a831218abe2f798820b885312d45708a0bb63068f74c91d759fe3330fd521","observation_id":"ccacbda3-33ca-4d30-a573-22c608da1381","resolution":{"observed_at":"2026-08-11T23:35:20.281463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.286155Z","title":"Enhancing video-language representations with structural spatio-temporal alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.286155Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:00d60e0203a8d373cb94afed845bc9f8e7c982c4eaa2b7dc120b0a351246dd31","observation_id":"5f36c49f-a69c-45f6-9919-79725e0eb90c","resolution":{"observed_at":"2026-08-11T23:35:20.286155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.290172Z","title":"Free-form description guided 3d visual graph network for object grounding in point cloud","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.290172Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:92b067218b83838f7bab90465b23b6503d0a498433f5612a3888ac069edf2bb5","observation_id":"5d7c917a-d0e2-4e00-97b0-1688810e1c8f","resolution":{"observed_at":"2026-08-11T23:35:20.290172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-13T00:52:19.292622Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-11T23:35:20.294196Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.294196Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:d7a4e05c93bcd8f4732dd5b5610f63edf03d15545c0541ed5e07991e195191f8","observation_id":"a072464d-e775-4f20-a086-1fc5fd323162","resolution":{"observed_at":"2026-08-11T23:35:20.294196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.298756Z","title":"Structured multi- modal feature embedding and alignment for image-sentence retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.298756Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:6606e5b6d273761cb40bac90564b2048389cadd7058b0c8ceef21c86b8333a24","observation_id":"dd6ba9dc-c8f1-4de6-b1f3-92eb9eb59cdd","resolution":{"observed_at":"2026-08-11T23:35:20.298756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.302786Z","title":"3shnet: Boosting image–sentence retrieval via visual semantic–spatial self-highlighting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.302786Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:147ce88cb0887e98493da69ca695900cd0ac0214b42c251a305b5cdb940fb135","observation_id":"5240e487-12a5-4aee-a80c-b9c08f1d5c58","resolution":{"observed_at":"2026-08-11T23:35:20.302786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.943600Z","title":"Vqa-lol: Visual question answering under the lens of logic","venue":null,"work_id":"60b11b63-5bbd-4723-94db-fe083cc612de","year":2020},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.307081Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:fc2cd1d57474ca7a95aec646517cec295d2f13203b42f39d2dcdc4a22b8bd3b3","observation_id":"8df2d7c9-d48d-4016-93a4-10e8a36c739f","resolution":{"observed_at":"2026-08-11T23:35:21.948690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.927657Z","title":"Person re-identification method based on color attack and joint defence","venue":null,"work_id":"a9c3d049-cf8a-4b59-9586-f2b1506914f9","year":2022},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.314186Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:0b7986f383e5852db78e9dabc6803ec02a5946fd1d506d8e374f83e64c82a6ed","observation_id":"897f0df5-a29a-4306-a367-ee33934d29fc","resolution":{"observed_at":"2026-08-11T23:35:21.932779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.319004Z","title":"3d semantic segmentation with submanifold sparse convolutional networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.319004Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:f22eaf85ab5fb0574c305959949f6b335dfc3b286bb1590ba0753a3ed576fa90","observation_id":"4c7deca1-cbb8-4cee-8693-e6a5b4dfa186","resolution":{"observed_at":"2026-08-11T23:35:20.319004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.901220Z","title":"Segpoint: Segment any point cloud via large language model","venue":null,"work_id":"cf1ee9f1-f098-455b-bd71-bd0d06094b8f","year":2025},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.323821Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:e710034998f40f9e25bf98de0b217bda6dd5ca51e3375bb3308803a3ca8413bd","observation_id":"dfc35995-6698-40b7-b170-4d0f3c04438d","resolution":{"observed_at":"2026-08-11T23:35:21.906666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.328792Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.328792Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:c192e4e67c89f65de3864272df26512c34588f62d0cce984f9874159f7158a68","observation_id":"d407bdaf-be1f-423e-a986-861936cedd2a","resolution":{"observed_at":"2026-08-11T23:35:20.328792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-13T05:03:16.391892Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-11T23:35:20.333277Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.333277Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:03ae2c81a7a5ce8e3a78c3460cc72d34b5f49ee54e9c401ff50ad439396aa1b6","observation_id":"9ea74b37-bbbf-49b7-9edf-769a8dc1b8c2","resolution":{"observed_at":"2026-08-11T23:35:20.333277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17427","last_updated":"2025-02-09T07:32:21Z","snapshot_observed_at":"2026-08-12T23:56:51.147949Z","submitted_at":"2024-05-27T17:59:41Z","title":"Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17427","snapshot_observed_at":"2026-08-11T23:35:20.338471Z","title":"Reason3d: Searching and reasoning 3d segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.338471Z"},"links":{"cited_paper":"/paper/2405.17427","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:0bab3eb613228aa35677555e8034624d889ac5afc6267666a47def96f9a83769","observation_id":"691a22b6-8e62-41fd-9020-fb9b3ad7ce03","resolution":{"observed_at":"2026-08-11T23:35:20.338471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.343905Z","title":"Text-guided graph neural networks for referring 3d instance segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.343905Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:1462d0dc90923e76b00d0e1ea65bcd54ec032d3ac21e361a215b89e67ffe2e68","observation_id":"e1e7b209-f73d-4c38-a180-d146645478ac","resolution":{"observed_at":"2026-08-11T23:35:20.343905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.348573Z","title":"Referring image segmentation via joint mask contextual embedding learning and progressive alignment network","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.348573Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:b922290f9a17d7becc6d9e96f266395507e45d17caf1c91da0b6e514a56733a1","observation_id":"86865ac9-c6c7-45cd-b682-100b786c5381","resolution":{"observed_at":"2026-08-11T23:35:20.348573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.353513Z","title":"Bottom up top down detection transformers for language grounding in images and point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.353513Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:7b5c37dfc22eaa2fcc73641d33e17c5e2c8084beb0e3f09649e6ba7edd555ce0","observation_id":"7ff30ec0-7027-4525-b672-9fdc7dc4c104","resolution":{"observed_at":"2026-08-11T23:35:20.353513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.851916Z","title":"Comprehensive multi-modal interactions for referring image segmentation","venue":null,"work_id":"506fec71-edac-445d-9b21-49e9e0e15deb","year":2022},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.358251Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:5bb75b1b26359a7169aa5371434943ec34733a0e9101d14383137f4e2c410457","observation_id":"5e9ce923-4eec-41b9-b426-0ecfd825ae0e","resolution":{"observed_at":"2026-08-11T23:35:21.857343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.03063","last_updated":"2019-12-06T11:04:08Z","snapshot_observed_at":"2026-08-09T14:33:55.055015Z","submitted_at":"2019-12-06T11:04:08Z","title":"Weak Supervision helps Emergence of Word-Object Alignment and improves Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":"1912.03063","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.03063","snapshot_observed_at":"2026-08-11T23:35:20.979303Z","title":"Weak Supervision helps Emergence of Word-Object Alignment and improves Vision-Language Tasks","venue":"cs.CV","work_id":"5bfe12f0-5918-437d-b5be-e70fbe4bcfa7","year":2019},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.362722Z"},"links":{"cited_paper":"/paper/1912.03063","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:abb25f1c4dfadf044b0da870918cbb0368db1c1e92e89e4ae0011dca1469b418","observation_id":"5ecf5cb1-3442-460f-bd97-e2179ad1acd9","resolution":{"observed_at":"2026-08-11T23:35:20.984655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.367678Z","title":"Flexible visual grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.367678Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:63363817133be5659b80ef9d4ec8275cb0aaa68175f13033f1a35337283e55bb","observation_id":"5b6d9b74-b99c-47cf-8df3-40cb84a9646a","resolution":{"observed_at":"2026-08-11T23:35:20.367678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.835583Z","title":"Stratified transformer for 3d point cloud segmentation","venue":null,"work_id":"6a9cf18d-17b4-44b2-a9a3-3d31ca9db6af","year":2022},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.372326Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:6eba3b485cb824cb0afc2604231b6957fef189fc2780857db30d8b7aa4b3ba54","observation_id":"23b67e82-1e64-4f4f-8748-6df33ed8ba79","resolution":{"observed_at":"2026-08-11T23:35:21.841054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.818224Z","title":"Mask-attention-free transformer for 3d instance segmentation","venue":null,"work_id":"265b23f0-c184-4e45-ade9-d09a05bed869","year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.377072Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:523c12b8e81eb02a7497691a3a1b34c07592582d23032f89d10e49b533d86928","observation_id":"f9134daf-ecde-4535-8558-0a223070e87b","resolution":{"observed_at":"2026-08-11T23:35:21.823421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.801366Z","title":"Large-scale point cloud semantic segmentation with superpoint graphs","venue":null,"work_id":"f4d3d294-a5a3-4b87-850a-74545a404853","year":2018},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.381838Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:56d3aea638d073fd1b26db74fe139b1551bf12a2ed65177bcfb9f8906e3c3ccf","observation_id":"a75278c8-ea1f-4ae7-ac20-58ca0c0423ab","resolution":{"observed_at":"2026-08-11T23:35:21.806638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.784361Z","title":"Weakly supervised referring image segmentation with intra-chunk and inter-chunk consistency","venue":null,"work_id":"f4a4038c-2b17-420d-9f5e-0066913e07f6","year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.386542Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:07868abfc48a53e2ed16d27a870c1149eb692c8c8572fc6159b396a1f590eb72","observation_id":"1e2f7944-cbe1-4dc6-a99f-c6202e6f3995","resolution":{"observed_at":"2026-08-11T23:35:21.790357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.767224Z","title":"Fully and weakly supervised referring expression segmentation with end-to-end learning","venue":null,"work_id":"2f362148-d2fa-4b1b-b692-746373df3eb8","year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.391780Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:b87bd6a7ac461d848fbc6612fc39065934092bdb5c29f5e27b988ba6fe137d4c","observation_id":"5200bb1a-b612-42a5-b091-564413e63cb1","resolution":{"observed_at":"2026-08-11T23:35:21.773055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.750227Z","title":"Fine-grained semantically aligned vision-language pre-training","venue":null,"work_id":"dadb7bf7-19dd-443e-bd3b-c6ed7cd8a642","year":2022},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.396223Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:7747d4910349ab0c87cba72451e1730c6774d049df9b4b7b41012ff4e60829b7","observation_id":"abc6104c-4c98-47d9-91da-7d4ebacc9137","resolution":{"observed_at":"2026-08-11T23:35:21.755948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.400784Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.400784Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:d96794bcfe3da34f4435c217821bd9561faa736d073b386a5bc2b6c0bfc6747d","observation_id":"2de1f385-75fe-4565-8529-1ea59c171791","resolution":{"observed_at":"2026-08-11T23:35:20.400784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.405459Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.405459Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:06dd64f495bbf50fcd52ebf67d588dba4ea1f39ff9216dec0984777d81a15494","observation_id":"c3a78231-fd75-4047-869c-a2614e1e8b47","resolution":{"observed_at":"2026-08-11T23:35:20.405459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.712414Z","title":"Toist: Task oriented instance segmentation transformer with noun-pronoun distillation","venue":null,"work_id":"87af3c87-c820-450a-a73a-234e3b00f0b6","year":2022},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.410222Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:b55c10a4966442de103af4a52e1e21bdef95b3e03e9c46e6ae592ee9b3646d2a","observation_id":"eff90e3a-9b6e-4419-815b-3f703f76ecce","resolution":{"observed_at":"2026-08-11T23:35:21.717881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.694531Z","title":"Understanding embodied reference with touch-line transformer","venue":null,"work_id":"5ec74726-f087-4aa5-92ec-966f0145ae6b","year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.414906Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:050a57429f4a638cb29ccfe64966820e3b30047facc7c3da022a60f82faa58f4","observation_id":"3a6f97ec-6e78-4aa3-9678-072252225644","resolution":{"observed_at":"2026-08-11T23:35:21.700486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.677075Z","title":"Transformer-empowered invariant grounding for video question answering","venue":null,"work_id":"421c07fd-dd04-46ec-8436-ae3e1d5104fa","year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.419412Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:27e1f10c1dadcf54c68c5bc4b9317b0768f462fa61acb83c437b8fd582f516ae","observation_id":"525d8460-5579-44a8-9e64-32b9638cd338","resolution":{"observed_at":"2026-08-11T23:35:21.682439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.660433Z","title":"Laso: Language-guided affordance segmentation on 3d object","venue":null,"work_id":"df50111b-395f-4116-b829-32a5990d5c98","year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.424006Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:91b0ccc845df155bb652529b02f86cb2798ac7f03957661bb9982b7a6834865c","observation_id":"a61a852c-095a-44bd-91eb-17b7c7fdc2b3","resolution":{"observed_at":"2026-08-11T23:35:21.665764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.643312Z","title":"Instance segmentation in 3d scenes using semantic superpoint tree networks","venue":null,"work_id":"6267d9a0-3824-4546-9b6d-bd982b8ec76c","year":2021},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.428757Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:2ee97779e22ac039eee33bffc1988c804367105af699691f5380f4c07f4be70f","observation_id":"e03c661d-88ee-49b9-8d26-1c9e0b5ba7ef","resolution":{"observed_at":"2026-08-11T23:35:21.649250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11887","last_updated":"2023-11-20T08:57:58Z","snapshot_observed_at":"2026-08-13T10:29:18.203818Z","submitted_at":"2023-08-23T03:20:31Z","title":"A Unified Framework for 3D Point Cloud Visual Grounding","version":2},"cited_work":{"arxiv_id":"2308.11887","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.11887","snapshot_observed_at":"2026-08-11T23:35:20.957564Z","title":"A Unified Framework for 3D Point Cloud Visual Grounding","venue":"cs.CV","work_id":"61beb104-beeb-4ffb-941c-4f19b2db7098","year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.433380Z"},"links":{"cited_paper":"/paper/2308.11887","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:a0d0f671aec14c2b4390ee2342d72389ef8d111bc48346bc859e7961f566288a","observation_id":"401b6487-1e10-4102-b747-2d0b70773dc8","resolution":{"observed_at":"2026-08-11T23:35:20.962563Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.626686Z","title":"Referring image segmentation using text supervision","venue":null,"work_id":"ed5e3025-6dc4-42d5-be9f-345a15941920","year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.438339Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:679e8db71352f3560f2383d25e8180c33626b13fd6cc840f7f03c2fb87ac7f37","observation_id":"cc8be356-efdd-4477-8666-45810174251e","resolution":{"observed_at":"2026-08-11T23:35:21.632219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-11T23:35:20.442554Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.442554Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:886496cefd5a50397bab5002e522a74010b55246a17cf1fed4794c709c4ed5aa","observation_id":"ad626953-6202-426f-91e9-e41633bb18d0","resolution":{"observed_at":"2026-08-11T23:35:20.442554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.609287Z","title":"Scaneru: Interactive 3d visual grounding based on embodied reference understanding","venue":null,"work_id":"00513c95-39fb-453d-ad22-57762d3cf93a","year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.446933Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:c6f34c6c615cbe7f8f364ac7c8401bbbf5a1ac14a13bddd3cfbff40a75a3de0d","observation_id":"be229806-f0f1-4985-ada9-86e792f6e113","resolution":{"observed_at":"2026-08-11T23:35:21.615114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.451182Z","title":"3d-sps: Single-stage 3d visual grounding via referred point progressive selection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.451182Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:43e2fece9ccc30e9c9111e8563a1e5859df1de5ba99546db9c4024ab458c06fc","observation_id":"f8f36734-64ce-4e7e-b9f4-7cc6589206c5","resolution":{"observed_at":"2026-08-11T23:35:20.451182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.581403Z","title":"The stanford corenlp natural language processing toolkit","venue":null,"work_id":"8242aae2-ed55-4510-9ecc-760f38130dea","year":2014},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.455490Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:b0f9039ef42fe967e90454949c3ff13dba8ba0b191ff555d0054ad9752c06d1e","observation_id":"d77d5778-af78-4928-b193-6f69ca26310e","resolution":{"observed_at":"2026-08-11T23:35:21.586741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.459876Z","title":"V-net: Fully convolutional neural networks for volumetric medical image segmentation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.459876Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:749479825cc5468abb95e0e56bf86604476a1e4a72e7ddc4c7164ffa58e0ec7e","observation_id":"cfc0ccf2-800f-4554-ba21-1b64175489b5","resolution":{"observed_at":"2026-08-11T23:35:20.459876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.553506Z","title":"Weakly supervised video moment retrieval from text queries","venue":null,"work_id":"0fbe01c7-cd01-4960-a687-c4444ec56fff","year":2019},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.464165Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:936fc5fe29fe0c27c8a1e47c5c65168e496aed0286d641b91fbd3fda3a569c75","observation_id":"5586e9d9-e49f-45ac-aefa-cb2cf100d86e","resolution":{"observed_at":"2026-08-11T23:35:21.559697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15933","last_updated":"2024-02-24T23:31:34Z","snapshot_observed_at":"2026-08-13T04:10:48.302690Z","submitted_at":"2024-02-24T23:31:34Z","title":"Bridging the Gap between 2D and 3D Visual Question Answering: A Fusion Approach for 3D VQA","version":1},"cited_work":{"arxiv_id":"2402.15933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15933","snapshot_observed_at":"2026-08-11T23:35:20.921097Z","title":"Bridging the Gap between 2D and 3D Visual Question Answering: A Fusion Approach for 3D VQA","venue":"cs.CV","work_id":"e8bf2505-0e45-4a40-a6b5-bcbe3776d463","year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.468888Z"},"links":{"cited_paper":"/paper/2402.15933","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:6e0aa576857a70ff2a6486c46426a3aeb05cbb9eec19bf09ec6601bbc28e454e","observation_id":"62bd7a5c-4078-4e29-8bda-43fc4ea8c32e","resolution":{"observed_at":"2026-08-11T23:35:20.926325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.537191Z","title":"Deep hough voting for 3d object detection in point clouds","venue":null,"work_id":"6f8b9d30-934a-4ae9-a53e-1beb9dafb0ac","year":2019},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.473978Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:b5a581cdcb62889f3ca4094e361c62af2450154071f577b7b9ebde1e2265781b","observation_id":"a818af2c-e3fb-4f91-91c5-c9471079b479","resolution":{"observed_at":"2026-08-11T23:35:21.542229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.519765Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":"b6f28c29-0467-40ba-9ed0-ebf761ed39d2","year":2017},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.478744Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:d2f2177e3d5cc9f2b96d8c294eb6240b505be7392a44a1404dd07fbddcd987b0","observation_id":"8387d02a-0b29-4b4a-88af-94d117592b61","resolution":{"observed_at":"2026-08-11T23:35:21.525560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.502282Z","title":"X-refseg3d: Enhancing referring 3d instance segmentation via structured cross-modal graph neural networks","venue":null,"work_id":"b50de956-b9fd-4f7f-a00f-1e5ce7f24e9f","year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.483640Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:9b37d1773c8ed4dfa228b69c58abb453afe9bab8414cc31df8fb529427e80a24","observation_id":"0d4b4a55-8d99-4297-a8f9-931ded1ef39a","resolution":{"observed_at":"2026-08-11T23:35:21.507677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.488477Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.488477Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:7892c49473e066eecf7307dea51218f56dfc9da1024e3feb83184fb481f392d9","observation_id":"338825f4-7d69-4a2c-aa16-491c5f84b807","resolution":{"observed_at":"2026-08-11T23:35:20.488477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.493295Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.493295Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:b5f50c41f99d43ef93428fa5bb4d85e9b9e6d41f7624df63371124aa2cc75ba0","observation_id":"3e890971-ef3d-4bd0-bad6-5816dabfeefc","resolution":{"observed_at":"2026-08-11T23:35:20.493295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03105","last_updated":"2023-04-12T09:22:53Z","snapshot_observed_at":"2026-08-13T14:11:03.699375Z","submitted_at":"2022-10-06T17:55:09Z","title":"Mask3D: Mask Transformer for 3D Semantic Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03105","snapshot_observed_at":"2026-08-11T23:35:20.498039Z","title":"Mask3d for 3d semantic instance segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.498039Z"},"links":{"cited_paper":"/paper/2210.03105","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:7d03abd968bcea67e6bfb1775328313da013f5e4996252e46b348d333b722f98","observation_id":"cf4a6b87-c014-4444-8323-8ef14e958b4f","resolution":{"observed_at":"2026-08-11T23:35:20.498039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.464068Z","title":"Mpnet: Masked and permuted pre-training for language understanding","venue":null,"work_id":"d0a4d422-b0af-4639-92dc-32bcf6b1df28","year":2020},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.503343Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:d6f5bb7587499400f1b3f1418e5cc318334175d22db8e50f143e90445321fded","observation_id":"444bc12b-700f-4626-8c0f-217496f9a719","resolution":{"observed_at":"2026-08-11T23:35:21.469640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.357","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.726787Z","title":"ReCLIP: A strong zero-shot baseline for referring expression comprehension","venue":null,"work_id":"57d94b97-ec5d-4bf9-a5c9-2c0902ab42d8","year":2022},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.508347Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:e1d177d875bbe029dfc2adce065dfae0d9d43f9a7d0290a5e23411694da8d5a8","observation_id":"5b8c2274-ed08-4afc-bd08-7f279f839f40","resolution":{"observed_at":"2026-08-11T23:35:20.731696Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.448004Z","title":"Superpoint transformer for 3d scene instance segmentation","venue":null,"work_id":"c75d872c-8edb-4aff-843b-fb376a05da12","year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.513161Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:ac68e2925ec59f4877c97cf370e23df160b89d000c0b68b91fd4efc875e412de","observation_id":"24502735-7495-43bd-a1bc-ad5f5dce8b80","resolution":{"observed_at":"2026-08-11T23:35:21.453210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.517871Z","title":"Text augmented spatial aware zero-shot referring image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.517871Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:456436a1fc7cd3f677d3b2ccce8f2670b345568585d7bad7a77b8ec4d0c6b7fe","observation_id":"6da5567f-2150-4860-bd4c-c5646015dad6","resolution":{"observed_at":"2026-08-11T23:35:20.517871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.08697","last_updated":"2018-03-02T03:00:43Z","snapshot_observed_at":"2026-07-06T06:15:53.038839Z","submitted_at":"2017-12-23T01:44:45Z","title":"Interpretable Counting for Visual Question Answering","version":2},"cited_work":{"arxiv_id":"1712.08697","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.08697","snapshot_observed_at":"2026-08-11T23:35:20.882439Z","title":"Interpretable Counting for Visual Question Answering","venue":"cs.AI","work_id":"9e3649a7-ff61-4561-af25-a625b151e968","year":2017},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.522490Z"},"links":{"cited_paper":"/paper/1712.08697","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:ad5335c5e40c44036262088c8fbbf4346fa77610c6ae1aa9907c31b7ac83f184","observation_id":"476a9e87-7043-404f-ac7e-9bb720dfc74d","resolution":{"observed_at":"2026-08-11T23:35:20.887589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.527617Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.527617Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:74d99112869632b915fdadc4e2fdb9f723d1fc995af0a9090bc01e3ccbfed344","observation_id":"0740510a-5569-468f-935b-f2a0b1e7cb39","resolution":{"observed_at":"2026-08-11T23:35:20.527617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-13T10:33:17.141989Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-11T23:35:20.532072Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.532072Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:5fce5b5dc3fbdadcbf38f47b748c5e45505ac1ebd6e8891271af1c3becf00f2a","observation_id":"613c5d7b-3253-4f5b-8695-fbcf3c40f772","resolution":{"observed_at":"2026-08-11T23:35:20.532072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16632","last_updated":"2023-08-31T11:00:03Z","snapshot_observed_at":"2026-08-13T10:23:33.691886Z","submitted_at":"2023-08-31T11:00:03Z","title":"3D-STMN: Dependency-Driven Superpoint-Text Matching Network for End-to-End 3D Referring Expression Segmentation","version":1},"cited_work":{"arxiv_id":"2308.16632","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16632","snapshot_observed_at":"2026-08-11T23:35:20.845998Z","title":"3D-STMN: Dependency-Driven Superpoint-Text Matching Network for End-to-End 3D Referring Expression Segmentation","venue":"cs.CV","work_id":"06e7a394-68ae-416d-b78a-996d3e81234f","year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.536982Z"},"links":{"cited_paper":"/paper/2308.16632","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:77e79cf553d2b4485128bca8bef62445c6675fba1b1bc8f22a8c9d31887749c1","observation_id":"d7df6c1e-4204-4312-8ea8-84228356509b","resolution":{"observed_at":"2026-08-11T23:35:20.851094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20664","last_updated":"2024-07-31T11:11:20Z","snapshot_observed_at":"2026-08-12T23:12:12.926063Z","submitted_at":"2024-07-30T08:59:05Z","title":"3D-GRES: Generalized 3D Referring Expression Segmentation","version":2},"cited_work":{"arxiv_id":"2407.20664","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.20664","snapshot_observed_at":"2026-08-11T23:35:20.823687Z","title":"3D-GRES: Generalized 3D Referring Expression Segmentation","venue":"cs.CV","work_id":"16b9eaad-bfa3-4cf2-a079-e9b3f8783639","year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.542038Z"},"links":{"cited_paper":"/paper/2407.20664","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:4daac76fbd1e7644944499ab895e4ac702b72a9b7b8e89f26308262b916d77a1","observation_id":"ede7de22-f7a1-4904-9b6b-ac5363ee29b4","resolution":{"observed_at":"2026-08-11T23:35:20.829312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.419759Z","title":"Rethinking and improving relative position encoding for vision transformer","venue":null,"work_id":"9da22509-bf71-420f-b345-42db974853e3","year":2021},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.546980Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:5cb9a57a43ba9cfc6f2990367ef5fb92d91c62793f6c26c2ddaf309e12b7e3e5","observation_id":"c75f2d21-f628-43ba-a8a8-52e06e9695b2","resolution":{"observed_at":"2026-08-11T23:35:21.426059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05127","last_updated":"2025-02-26T02:55:53Z","snapshot_observed_at":"2026-08-12T23:47:39.732802Z","submitted_at":"2024-06-07T17:55:43Z","title":"Towards Semantic Equivalence of Tokenization in Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05127","snapshot_observed_at":"2026-08-11T23:35:20.551468Z","title":"Towards semantic equivalence of tokenization in multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.551468Z"},"links":{"cited_paper":"/paper/2406.05127","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:0cea90d9a00fb23aff46987595c04b8452645f4fdf677772dfcb80616b3dd321","observation_id":"5cc55593-1a95-40cc-ba82-8f53107d540f","resolution":{"observed_at":"2026-08-11T23:35:20.551468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.403267Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"b4f1ac81-5546-4a68-8ed1-eaba59be18d4","year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.556187Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:0cfe8a82e891cfd95d75541c4fc612b5d2ca76d49f61858737a68790966d804d","observation_id":"ad106fa6-16d3-4087-9cb3-533c3fe885a2","resolution":{"observed_at":"2026-08-11T23:35:21.408387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.388655Z","title":"Eda: Explicit text-decoupling and dense alignment for 3d visual grounding","venue":null,"work_id":"79cc4046-1ffc-4c1e-9b56-9e66a82c4e2c","year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.560544Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:6aa0736e1db0d8823cbf5a4b3838bf21e8c35c291e26d4363e94bc18dfef36af","observation_id":"9eff1af7-21a2-49c2-8c9e-546f7c1ce603","resolution":{"observed_at":"2026-08-11T23:35:21.393168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03263","last_updated":"2024-11-27T15:08:34Z","snapshot_observed_at":"2026-08-12T23:29:26.603644Z","submitted_at":"2024-07-03T16:50:07Z","title":"A Unified Framework for 3D Scene Understanding","version":2},"cited_work":{"arxiv_id":"2407.03263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.03263","snapshot_observed_at":"2026-08-11T23:35:20.784428Z","title":"A Unified Framework for 3D Scene Understanding","venue":"cs.CV","work_id":"cf485350-bb2d-40cb-a4d7-1ef3a2bf63f9","year":2024},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.565037Z"},"links":{"cited_paper":"/paper/2407.03263","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:25fc58cc58ec6071dc700f3cab3f557268e723cc5caefe59bf2cbca842ddc6f6","observation_id":"059ce938-98dd-4ae4-95f1-973f9f4bfa34","resolution":{"observed_at":"2026-08-11T23:35:20.790252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.373193Z","title":"Sat: 2d semantics assisted training for 3d visual grounding","venue":null,"work_id":"14d58e31-5266-4684-a617-091e550c6969","year":2021},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.569392Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:6c0050f64d2d7a6238ac0d69e68e497eb0bc01553efd08fdf01ad4a2a897c90a","observation_id":"438d85db-fb73-4b6b-9456-8d093fe80274","resolution":{"observed_at":"2026-08-11T23:35:21.378358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.573330Z","title":"In- stancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual referring","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.573330Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:126cca95397e4a4757e7c1d3276bd3567aed13fe57e738e4fb1b4742cef1d690","observation_id":"7e80e01f-b43f-476c-bce1-a5182a3aa5ab","resolution":{"observed_at":"2026-08-11T23:35:20.573330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-eacl.196","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.696586Z","title":"CK-transformer: Commonsense knowledge enhanced transformers for referring expression comprehension","venue":null,"work_id":"cf8bdf66-896a-4b99-aace-e046240c50ec","year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.577618Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:0bf575af14ec456cd6e66e8707b6e036273fda20c1bae79f18adaaa716ae1fc9","observation_id":"d33a0356-a7ef-4a71-a945-043ce0987598","resolution":{"observed_at":"2026-08-11T23:35:20.703936Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:20.581722Z","title":"3dvg-transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.581722Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:050bc889dd9268de51a16c123a3f354bab19a415bf2ee4359e37303ef78b61fc","observation_id":"86a2e0f9-8981-4c1e-b7df-990ee68c6a58","resolution":{"observed_at":"2026-08-11T23:35:20.581722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02010","last_updated":"2024-04-01T07:21:52Z","snapshot_observed_at":"2026-08-13T05:10:17.193337Z","submitted_at":"2023-12-04T16:32:51Z","title":"Towards Learning a Generalist Model for Embodied Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02010","snapshot_observed_at":"2026-08-11T23:35:20.585860Z","title":"Towards learning a generalist model for embodied navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.585860Z"},"links":{"cited_paper":"/paper/2312.02010","citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:f2cd14f8cba58f9db34accaf7ea97a0fed3571f4ba91bc03d07177ea34730ded","observation_id":"0fdcb3aa-f801-4fb5-91cf-7c23597f5216","resolution":{"observed_at":"2026-08-11T23:35:20.585860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.338431Z","title":"left”, “right","venue":null,"work_id":"d67aa7ba-c9ea-4624-85f8-5a82a7b79276","year":2023},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.590132Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:cd7d11328d5f6957bf0daf4fd31e62336a841e2e877068639db5e460f874f0bd","observation_id":"d54b8337-8471-4c91-a165-0ab361378200","resolution":{"observed_at":"2026-08-11T23:35:21.342961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.322365Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"661b670d-d638-4749-839e-b3a40b56b8dc","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.595708Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:be73c6e6d377303a56e3c983bce4b33b783666cd659426ece7ac532b3447e2a6","observation_id":"4cc595ef-4e5c-4217-a288-46daf24a8e36","resolution":{"observed_at":"2026-08-11T23:35:21.326917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.306652Z","title":"Limitations","venue":null,"work_id":"f55d89da-1f7a-4266-85fb-6fa3c9265509","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.600631Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:9e5a3b98a2b6cf57c6fa16ef7c4e9ad794b53210c0990e3f54d400d8c3f27744","observation_id":"de3711d3-b46c-4c83-b6bf-241876dd6d00","resolution":{"observed_at":"2026-08-11T23:35:21.311479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.290367Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"60233eb6-8313-4680-9a89-8bc5cbdaaf48","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.605602Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:5be901c73000ab6bd80fb5f7788e611abae01a04104f71d23a2bf66b34128c68","observation_id":"59c0f4a0-4694-41b7-b8c4-15d84606ef57","resolution":{"observed_at":"2026-08-11T23:35:21.295825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.274208Z","title":"Detailed experimental settings are provided in Sec","venue":null,"work_id":"2a61051d-a8fe-4158-b325-a47026214a21","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.610880Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:4700fbf21317a3b9d6dd0c93f3ed52a9e09097c094ccfcfb0b58865aa6129a79","observation_id":"d6c2dc30-f5d8-488c-ae09-38aad1bbf276","resolution":{"observed_at":"2026-08-11T23:35:21.279306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.258300Z","title":"Guidelines: • The answer NA means that paper does not include experiments requiring code","venue":null,"work_id":"1098eb2e-b844-42a2-978e-93026f44407d","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.616330Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:76d7cc1ffc00b6754770313a85b42158e3a3238461b367f7c5fbc6358bb548f9","observation_id":"9c7ff5a0-ce16-4925-b393-4d7f88552dbf","resolution":{"observed_at":"2026-08-11T23:35:21.263315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.242389Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"5756c1ff-4195-4bf6-9be7-1cade484070d","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.621089Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:cdf9fccee7b2a43425937a1e3528556cf14e142324e7f8938636e25113a56a6b","observation_id":"d7a9b8d7-2e54-414b-942f-c7960e97ee15","resolution":{"observed_at":"2026-08-11T23:35:21.247433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.226859Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"d9a416b2-4370-4ec7-a15d-55848dfc7493","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.626328Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:558f2b471fcc18195519200c11d8e25aa0a38bcbe5d933c76f538d6bb22c502b","observation_id":"b486fab9-93d7-4c22-9610-d7ae331c1cc3","resolution":{"observed_at":"2026-08-11T23:35:21.231667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.211676Z","title":"4 and Appendix","venue":null,"work_id":"5a6b7630-e446-46ba-8e4b-8c1a500e7441","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.630884Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:5b7a8adbbbcff395d498afe1c647c584b8b69a2c9d8382b787e95eb275163f30","observation_id":"93ee714e-964b-475e-9f53-dbaa90981f14","resolution":{"observed_at":"2026-08-11T23:35:21.216461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.195446Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"0fd90cc6-5b5d-4566-97e8-22fad52359df","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.636245Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:5112b767cc12aee1b58316d2f9c2020f5cfdf216d57d38e093d01cd2a5a98415","observation_id":"ecc6d0c8-f297-42da-b618-b0ccba2d105e","resolution":{"observed_at":"2026-08-11T23:35:21.200530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.179099Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"993ad9b3-f68e-4569-b3a6-32e63634a84c","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.640947Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:8b9aa9d6d04473abfaa2de175c177848f11e32ca96ac5bf4d9e0559da10d682c","observation_id":"91270bbf-d720-496c-b11d-6b9d2c9ed8fa","resolution":{"observed_at":"2026-08-11T23:35:21.184463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.162518Z","title":"Guidelines: • The answer NA means that the paper poses no such risks","venue":null,"work_id":"d3cdb184-d96a-4bdd-8d4d-4281aa558476","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.645494Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:5aebe69d356218ebe99f36258a46ad56c8e1be8cdf6d331945a762d145b145eb","observation_id":"5ffc036e-e8eb-412e-a69b-100558a344ae","resolution":{"observed_at":"2026-08-11T23:35:21.167682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.148083Z","title":"Guidelines: • The answer NA means that the paper does not use existing assets","venue":null,"work_id":"94a9d52c-856f-49b7-9532-27437577825a","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.650172Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:bff338e526789b1666d684af0d20808c757e88af0480b5e4a2a4a35fa2291129","observation_id":"1e1d8fec-e327-4ffe-ad79-99b3cab1b7fa","resolution":{"observed_at":"2026-08-11T23:35:21.152549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.134015Z","title":"Guidelines: • The answer NA means that the paper does not release new assets","venue":null,"work_id":"286b6580-bf99-438c-b288-7496954c3868","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.654903Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:2b22db34d183116281eaba64f63504a5747a1bdb82a5b7ac41f74344a64263a4","observation_id":"782fdb6f-179a-49c2-9882-02215be6d888","resolution":{"observed_at":"2026-08-11T23:35:21.138405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.117842Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"3a142834-2736-4d2e-ac01-3afd17110408","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.659462Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:01fd31b18aa58f32d438ea78746f5dcfa4535de0dc600f6d6244a176c9ff403a","observation_id":"3245ba21-ac48-4dea-8810-0c24557492e3","resolution":{"observed_at":"2026-08-11T23:35:21.122814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:35:21.102238Z","title":"Guidelines: 27 • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"4e1dea2c-36f0-46af-b36b-0e52d9c54c15","year":null},"citing_paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T23:35:20.663843Z"},"links":{"citing_paper":"/paper/2412.02402"},"observation_digest":"sha256:b92c34947f49aa1d9b02746e1ce16f1cf974f808f7ced18fa800755d88038c3c","observation_id":"51bc7f0f-8e6b-4b00-86cb-ec6946077897","resolution":{"observed_at":"2026-08-11T23:35:21.107264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.02402","last_updated":"2024-12-22T10:51:52Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T23:23:26.142043Z","submitted_at":"2024-12-03T11:50:16Z","title":"RG-SAN: Rule-Guided Spatial Awareness Network for End-to-End 3D Referring Expression Segmentation"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":11,"verified_fuzzy":44},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 0 inbound Pith citation observations for arXiv:2412.02402."}