{"as_of":"2026-08-08T07:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:924b62fef38d1906c48420c94fba6c7e4a5124924ab1f2450f7170edd2d79f22","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:18:14.922481Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.11261/citation-record","integrity":"/paper/2507.11261/integrity","json":"/paper/2507.11261/citation-record.json","paper":"/paper/2507.11261"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:23.341378Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"96f31d3e-8081-4246-b273-ce2551aa4b2c","year":2020},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:10.932060Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:fd3a59bdcd1a451c61ea55a05356dd2282e0ab6f824a841519c8cf9f44f31653","observation_id":"99a5221d-5176-43af-abae-2f73a0eb4af0","resolution":{"observed_at":"2026-08-06T17:18:23.475431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:23.066605Z","title":"Cot3dref: Chain-of-thoughts data-efficient 3d visual grounding","venue":null,"work_id":"3e17ea2c-39a3-42aa-a8c3-07b8a5f95c3d","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.018378Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:560a6ad3457df145af0effb2d61ed68caec2d23993914740dfd140da8fea7ebc","observation_id":"f975c64a-485f-4d78-9f8d-dc42fbe8e48a","resolution":{"observed_at":"2026-08-06T17:18:23.222477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:22.867187Z","title":"Visual question answering from another perspective: Clevr mental rotation tests","venue":null,"work_id":"145a8ccd-7a2d-4a5c-82d8-f497ecd0879e","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.096372Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:85f63bb4dee1d8e046f8deb495c3f4b6960d12970de228cf8c45cf43f77a00d7","observation_id":"f4e61f26-db46-490f-aba8-0eb1df005f13","resolution":{"observed_at":"2026-08-06T17:18:22.964487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:22.678992Z","title":"Assertiveness-based agent communica- tion for a personalized medicine on medical imaging diag- nosis","venue":null,"work_id":"8d278235-1d76-4b2c-b51d-371958c8b1df","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.162571Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:dc0868ca1d800d395f9b1a96a98036e3115ddc5b2cb5cd7f493a2e04478a682d","observation_id":"d4dc29a6-0669-4bdd-976d-eb467977906c","resolution":{"observed_at":"2026-08-06T17:18:22.729024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:22.496937Z","title":"Mikasa: Multi-key-anchor & scene-aware transformer for 3d visual grounding","venue":null,"work_id":"1661686d-d15a-464c-86fe-09cefada1ff7","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.232514Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:a2e6acd56cc387540d60242e99d7ec1fde751dd38a97e21f373e600532a702e3","observation_id":"a17f72e6-33c7-48fc-a038-94af86b7efcf","resolution":{"observed_at":"2026-08-06T17:18:22.578516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:22.293578Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"64dc8009-1aea-4e9f-8527-987e1d33e7dd","year":2020},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.272693Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:d11cf6ad637291426511d094eba9127b98f77111da604f47b626c8aaab98bb62","observation_id":"526e06e0-2a1c-4bec-b757-a07af60d434d","resolution":{"observed_at":"2026-08-06T17:18:22.419009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14097","last_updated":"2025-07-05T06:26:01Z","snapshot_observed_at":"2026-08-07T16:55:21.515278Z","submitted_at":"2025-03-18T10:14:49Z","title":"SCJD: Sparse Correlation and Joint Distillation for Efficient 3D Human Pose Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14097","snapshot_observed_at":"2026-08-06T17:18:11.315194Z","title":"Scjd: Sparse correlation and joint distillation for efficient 3d human pose estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.315194Z"},"links":{"cited_paper":"/paper/2503.14097","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:501097c4be844802cbc66f14fb568487bc292f1f7b428eaa51b6ed2387956ec7","observation_id":"59de1d01-e895-4fa6-baea-6d5f6edca71a","resolution":{"observed_at":"2026-08-06T17:18:11.315194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:22.174700Z","title":"Talk2bev: Language-enhanced bird’s- eye view maps for autonomous driving","venue":null,"work_id":"c784c20e-af1b-40bf-93de-301b9831ac33","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.372304Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:0fb19110f4dc0840349ea0e239df3433eee54f3e9de39aea219487d969c43f71","observation_id":"eccb3eba-6be2-470e-bbeb-bf59790be25d","resolution":{"observed_at":"2026-08-06T17:18:22.228420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.973515Z","title":"Drive as you speak: Enabling human-like interac- tion with large language models in autonomous vehicles","venue":null,"work_id":"f36760b7-eeb3-4a60-8101-d31d6c77db61","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.459556Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:106fb7ab7571b4f7c088ed5d3a8bbf5fda18923ac21f211f2392f6d416d24bd6","observation_id":"1dc3fd23-afd9-4983-abd1-963c1e72f9a5","resolution":{"observed_at":"2026-08-06T17:18:22.060228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:11.526902Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.526902Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:18c32d318c3a5b03b5e1b73a30959ca8d63e5be67b5a42f594733058a47338e4","observation_id":"1c2babb7-5748-4946-a129-a39f62ca7b64","resolution":{"observed_at":"2026-08-06T17:18:11.526902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T17:18:11.558820Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.558820Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:7d2a8eeb05525c4f67a6be37dadad702a401beb1dda088766226857b8f621d64","observation_id":"0ffb4a29-cc63-41ed-8328-6490f340850e","resolution":{"observed_at":"2026-08-06T17:18:11.558820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.780888Z","title":"Scenegenie: Scene graph guided diffusion models for image synthesis","venue":null,"work_id":"832614d8-169a-4109-b552-e9241512d7f3","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.609396Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:ab973cfa7668a5d4cff4c1fb5ae8994068ebbc45039ec3e41cd51e3fb671685a","observation_id":"ade96116-986d-4715-878b-0a4040aa684d","resolution":{"observed_at":"2026-08-06T17:18:21.859773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.634383Z","title":"Dense reinforce- ment learning for safety validation of autonomous vehicles","venue":null,"work_id":"0b97cbb7-aaec-40eb-9244-c091a5c2e628","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.725233Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:fe09acf5a337cded6ca999bae9d9a2d642739c237f75a698b9d74e6067b1050c","observation_id":"94dd748e-1e5b-4db3-abdf-d3114273a179","resolution":{"observed_at":"2026-08-06T17:18:21.686087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.483733Z","title":"Viewinfer3d: 3d visual ground- ing based on embodied viewpoint inference","venue":null,"work_id":"ab85b0e7-2974-42f4-839f-dc6c11557b73","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.814980Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:89840572ea6795cc06d66758d05f6591b69eb3c83e009e8ef02ae1888654c2cb","observation_id":"af1fb14e-7516-443a-8274-73fcc2fbc43c","resolution":{"observed_at":"2026-08-06T17:18:21.525736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.315830Z","title":"Viewrefer: Grasp the multi-view knowledge for 3d visual grounding","venue":null,"work_id":"19b4c82a-39ca-4ed6-bff1-98cdf5498d6f","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.879963Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:9b546c6b38b31bf10358a58fbaf044cc75c0a49ba542a25e07afcfa06298616a","observation_id":"e05dd4c4-9cf5-4bd0-8f03-d88fee1038db","resolution":{"observed_at":"2026-08-06T17:18:21.382853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.169607Z","title":"Transrefer3d: Entity-and- relation aware transformer for fine-grained 3d visual ground- ing","venue":null,"work_id":"139573ea-f9a8-4e32-a725-9eef119f4f0c","year":2021},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:11.960630Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:bdcc2b0480b2a6ecd4ee4971dae2d59f971a39400cb4a128db3bfaa3418cbac5","observation_id":"10802696-30ec-4432-802d-8d1ad2a2a2ba","resolution":{"observed_at":"2026-08-06T17:18:21.222781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:12.036499Z","title":"3d-llm: In- jecting the 3d world into large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.036499Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:9f0f6ead71fdeb1a7816d0b31f122569d86c88ee84b446080dfe865915bb13d8","observation_id":"871a281a-822f-48d2-b87e-f017dd6f71da","resolution":{"observed_at":"2026-08-06T17:18:12.036499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:21.041221Z","title":"Multi- view transformer for 3d visual grounding","venue":null,"work_id":"ed5f0271-0465-478e-b07d-cf81126aa699","year":2022},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.169841Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:04cf48a7e50f8ae41583fa991bd6c068d83eda5b2f795e3bc954d31f0e7e2a9c","observation_id":"be0bd385-f4ef-4432-8a79-37595d71b9e9","resolution":{"observed_at":"2026-08-06T17:18:21.108849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:20.866618Z","title":"Structure-clip: Towards scene graph knowledge to enhance multi-modal structured repre- sentations","venue":null,"work_id":"6dfef9ab-5c39-4454-9160-97b091ad2796","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.226913Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:38203eb111ab2658729462f81d35bc22f6b2ab4fba6833f21c6f7eef724e99ab","observation_id":"fe61d437-8966-45a3-b4d8-9ffb6c95ed08","resolution":{"observed_at":"2026-08-06T17:18:20.956537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:20.666524Z","title":"Nan-detr: noising multi-anchor makes detr better for object detection","venue":null,"work_id":"bb12491a-8090-4214-b32d-08bbd4ab6057","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.302592Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:46d38f5bdc80ec4dd6b673528c5ec7b0ffb49bf1baf9fb8ebdf7326a8671a95e","observation_id":"1447d34a-0364-45f7-9836-3487acfcbaec","resolution":{"observed_at":"2026-08-06T17:18:20.759454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:20.548287Z","title":"Bottom up top down detection transform- ers for language grounding in images and point clouds","venue":null,"work_id":"b3b5b988-9067-4b83-a2a1-a4217cef900d","year":2022},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.337407Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:af966866f452ca04fce946d1c2cd1f47a3d505f22b1b0a2f1f1d8b40f347e3ac","observation_id":"c7234e13-59d2-4e77-a0e8-722b6bfeb5ee","resolution":{"observed_at":"2026-08-06T17:18:20.616504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:20.431728Z","title":"Sita: Struc- turally imperceptible and transferable adversarial attacks for stylized image generation","venue":null,"work_id":"6f8f1691-7f20-4997-9992-18a7b15c7915","year":2025},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.420336Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:7035dd5c9fa7ec6cfebab93aa3483a4b8d6033b0ed9121eabc41889f85fe03c8","observation_id":"20737413-972d-41be-8b38-9cf6e05427b4","resolution":{"observed_at":"2026-08-06T17:18:20.474489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:20.259414Z","title":"Is-ggt: Itera- tive scene graph generation with generative transformers","venue":null,"work_id":"1122bcd8-f990-4c8f-8600-b6a3bb94bee4","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.464267Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:e7ab6283917f1fd39d9059c3a6c074e3a93ff878e94b3164732fae2dbe17b0b8","observation_id":"0a65a579-0f29-4f63-8d2d-aea7735b381e","resolution":{"observed_at":"2026-08-06T17:18:20.356956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:20.094485Z","title":"Panogen: Text-conditioned panoramic environment generation for vision-and-language navigation","venue":null,"work_id":"441201b4-9ea2-42b5-be83-004dd1d72d54","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.567526Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:98ec528a61fd86f2f09d3c8ee4f0df35a7e449be2b123ef8b7ebf336369bbe7a","observation_id":"379d5fb8-6792-49bd-994f-0a4a458fb316","resolution":{"observed_at":"2026-08-06T17:18:20.153322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.942491Z","title":"Delving into in- visible semantics for generalized one-shot neural human ren- dering","venue":null,"work_id":"34fdaa31-f458-4e22-86fb-b4dfeac837c3","year":2025},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.610425Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:bac78fce769452236c29cef73c480caeea74101807e349f8b001966d1e4cc480","observation_id":"10e9e04c-bdb5-43e1-9a72-f80606081a36","resolution":{"observed_at":"2026-08-06T17:18:20.017204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.843316Z","title":"Multi- modal situated reasoning in 3d scenes","venue":null,"work_id":"30ce3e49-75f3-4db0-897d-0dae8a4e6fb3","year":2025},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.672393Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:f1f2697684adb6330e9cb16244b1c355fafb5f57a013534a4320fa2944c27beb","observation_id":"eac386b2-18cb-4782-833e-b7e25bd217ad","resolution":{"observed_at":"2026-08-06T17:18:19.881172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T17:18:12.730320Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.730320Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:d188c69c1e7539a93a7fbb2f3c3ee6d007f3831c096a6e4c9bc2cd8e99e8f547","observation_id":"92964dcf-8d01-48f2-8a93-fcf256401bc5","resolution":{"observed_at":"2026-08-06T17:18:12.730320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.724820Z","title":"Rotation-adaptive point cloud domain generalization via intricate orientation learning","venue":null,"work_id":"ea169f5b-d9b5-475e-a79d-3993ab4d1d8b","year":2025},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.792481Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:b63bb1cdb6a47860929e0150651e56552469096fa8511140e2a61197db984b40","observation_id":"69934a9d-b77c-4eec-bdd4-0c747b923a4b","resolution":{"observed_at":"2026-08-06T17:18:19.793645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T17:18:12.856045Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.856045Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:16d4f84f2907bcf826feb5cbbfe3f56fc13266f34895a6c8f9ae4c1edae16aab","observation_id":"8d336ad7-7f9f-40a3-919c-4fe67cba887e","resolution":{"observed_at":"2026-08-06T17:18:12.856045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.580049Z","title":"Mmscan: A multi-modal 3d scene dataset with hierarchical grounded language annota- tions","venue":null,"work_id":"3da1b977-c4c9-4892-bd3d-0f31970cc2ec","year":2025},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:12.907511Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:6d43a1f7425a04e186c48380cccd3265e765cb8817f997fdecc80a83778156b3","observation_id":"f2e1b9c6-b79e-4826-b41e-d6d679641ab6","resolution":{"observed_at":"2026-08-06T17:18:19.641153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.474115Z","title":"Situa- tional awareness matters in 3d vision language reasoning","venue":null,"work_id":"ceb8e511-d4bc-4540-a692-7b6321af822b","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.002554Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:6ea7087c7791d39194b090fa3542c220d3afdc7a39942539a58b16748b94a695","observation_id":"6cb05e79-39f8-48c6-83b4-0778956ae5e7","resolution":{"observed_at":"2026-08-06T17:18:19.530994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.317379Z","title":"Textrank: Bringing order into text","venue":null,"work_id":"0eaf1266-e24c-4a72-9e80-7fcd98c026b3","year":2004},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.049968Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:1c950afff069f09e54f9389dd026fc914016851b66bf988bc198ed948dbb6b56","observation_id":"b1d8da55-3518-489d-841a-e30ffcb33ad9","resolution":{"observed_at":"2026-08-06T17:18:19.415622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.164207Z","title":"Gaussian prompter: Link- ing 2d prompts for 3d gaussian segmentation","venue":null,"work_id":"0d71f912-f4d9-49d5-8b50-b3901511c5bc","year":2025},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.117883Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:e37a4f415a8ec20823eaefce64196f759e8d8926e516ce3f1af07af76657a4f7","observation_id":"7baa5367-9431-4ebf-9dab-b0e614a4469c","resolution":{"observed_at":"2026-08-06T17:18:19.242942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:19.044388Z","title":"An approach to gener- ate a caption for an image collection using scene graph gen- eration","venue":null,"work_id":"78f9c680-2e97-4e38-8705-74fd0b7c45f1","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.165411Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:158ad6d82bcd8fb643d63a887c361888efeb55156875157323ce1a6dcd72b1c2","observation_id":"c0cb8c5d-fc43-440c-8122-b81e486fd0af","resolution":{"observed_at":"2026-08-06T17:18:19.100794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:13.209464Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.209464Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:cdceb5a6b7d8f87ce418efc79698e2d2fc8ddd32a76147cdceaa55a057991a6b","observation_id":"9d956151-940c-4880-8a83-724d8a8d0321","resolution":{"observed_at":"2026-08-06T17:18:13.209464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:18.726704Z","title":"Languagerefer: Spatial-language model for 3d visual grounding","venue":null,"work_id":"3e78bd6f-e90f-467f-95f2-649b91a11da9","year":null},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.264346Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:1723341aec7454695811faf4130c6b8184100b05e3f878817d6ae90d1db9d02d","observation_id":"7aca918f-4f06-4bbe-8c3a-8ccfbe288b3a","resolution":{"observed_at":"2026-08-06T17:18:18.899318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:18.477909Z","title":"Aware visual grounding in 3d scenes","venue":null,"work_id":"3ac552dd-bb4f-4be1-a5f3-4bb29560eb86","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.302172Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:61b21946f7c65c84eaa2d73428986291ebe259b2dc099f6af35c75265ddb1ae3","observation_id":"0dc6fb11-c63d-4a44-8000-0772f5480f73","resolution":{"observed_at":"2026-08-06T17:18:18.591055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03314","last_updated":"2023-06-05T23:55:37Z","snapshot_observed_at":"2026-08-05T20:35:55.884484Z","submitted_at":"2023-06-05T23:55:37Z","title":"Multi-Agent Collaboration: Harnessing the Power of Intelligent LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03314","snapshot_observed_at":"2026-08-06T17:18:13.353401Z","title":"Multi-agent col- laboration: Harnessing the power of intelligent llm agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.353401Z"},"links":{"cited_paper":"/paper/2306.03314","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:48ed40c130ab4b2e5b8e878e14d9f2994e5491aa764a48c4578842fdbc066c85","observation_id":"c8ca42ed-25ea-4e09-bf48-939444c1df02","resolution":{"observed_at":"2026-08-06T17:18:13.353401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:13.395000Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.395000Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:729c022189212ecb2458bff00d551743e75998a5a0aa747a729f638df422bf41","observation_id":"1478cb02-15b0-46d6-92fe-72defd0eb2b3","resolution":{"observed_at":"2026-08-06T17:18:13.395000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11235","last_updated":"2024-03-16T04:32:25Z","snapshot_observed_at":"2026-08-07T05:19:58.002826Z","submitted_at":"2023-09-20T11:54:40Z","title":"OpenChat: Advancing Open-source Language Models with Mixed-Quality Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11235","snapshot_observed_at":"2026-08-06T17:18:13.463357Z","title":"Openchat: Advancing open-source language models with mixed-quality data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.463357Z"},"links":{"cited_paper":"/paper/2309.11235","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:125e388d9a0650f441a838652e4bb0f676f18422abec9f854dde698aa2fa6560","observation_id":"3fb44b95-ce78-4a3d-a504-3ebc3c94a86f","resolution":{"observed_at":"2026-08-06T17:18:13.463357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:18.228521Z","title":"Gˆ 3-lq: Marry- ing hyperbolic alignment with explicit semantic-geometric modeling for 3d visual grounding","venue":null,"work_id":"f7511793-d7ac-4280-9490-e9ed87a0cb7d","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.530305Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:fab553615f6f565d63b934eca22fd3f2cbd409ed3292849966b36df9e293b163","observation_id":"4abf7b5a-2bff-4eba-b2a7-666fe6aa4823","resolution":{"observed_at":"2026-08-06T17:18:18.360406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:17.969482Z","title":"Eda: Explicit text-decoupling and dense alignment for 3d visual grounding","venue":null,"work_id":"07dae306-7be1-45da-8cc2-ba84326a2a20","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.577268Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:febba984250f2fc461404ab3fa7ef6f642393583a261291a90e1db710046c718","observation_id":"c3063547-1f1d-4b65-bd7c-d838fb358d06","resolution":{"observed_at":"2026-08-06T17:18:18.114493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:17.774580Z","title":"Multi- scale flow-based occluding effect and content separation for cartoon animations","venue":null,"work_id":"9d554149-90cf-46af-a308-fea106104224","year":2022},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.656275Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:43080cd334ec7b2d13ecf55ebf70f28598f6fc80a201806d5bbfc5239fd78faa","observation_id":"4f8a1019-7534-49a9-91ef-647eee7f552d","resolution":{"observed_at":"2026-08-06T17:18:17.875702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:17.527737Z","title":"Multi-attribute interactions matter for 3d visual grounding","venue":null,"work_id":"bb6dd697-51f5-4aac-a5e7-11950e36a46a","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.741285Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:172cc3ed9bfa87034d4ee7c974aa45e2aacce61c9b29e0ba89ce4257998ab20a","observation_id":"dc991a12-da9e-4040-aea2-80f2cd5f3ce3","resolution":{"observed_at":"2026-08-06T17:18:17.663023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:17.327969Z","title":"Learning with unreliability: Fast few-shot voxel radiance fields with relative geometric consistency","venue":null,"work_id":"4e2c86c7-4b90-4708-afe8-dde0e7247aa2","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.829101Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:02a44a76fb8845c633dfa47071eeaba4d2a8308c1af7998621038d68ea2ab13c","observation_id":"4f1a0181-73b4-4da4-9ebb-d7a7579bb0f1","resolution":{"observed_at":"2026-08-06T17:18:17.436049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T17:18:13.861692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.861692Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:fc3b4881f3b814f5086b6c66c1e475322a20c4ec2c29f2ae7f967b29fee9129d","observation_id":"8d5e569b-edb4-48de-9a4f-f24c278d71fa","resolution":{"observed_at":"2026-08-06T17:18:13.861692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:17.135089Z","title":"G2face: High-fidelity reversible face anonymization via gen- erative and geometric priors.IEEE Transactions on Informa- tion Forensics and Security, 2024","venue":null,"work_id":"46d12992-7857-496f-93aa-5c28e91cbe9f","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:13.971665Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:b41b95503899c6f895d393771991c6e40d4fcae1ad4fee9a7297d0230a5ff011","observation_id":"dee07287-1d11-4c9a-8419-d1521f62ed39","resolution":{"observed_at":"2026-08-06T17:18:17.218042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:16.839781Z","title":"Sat: 2d semantics assisted training for 3d visual grounding","venue":null,"work_id":"52e72f2e-8473-4165-9501-bb0b17702d77","year":2021},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.062628Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:c017cc4d16f7c92430fee25a0a3edd63b1732da22969d3290fa33e5e6c2ce091","observation_id":"410dc413-a061-453c-afe6-3e74887c004c","resolution":{"observed_at":"2026-08-06T17:18:17.017863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13771","last_updated":"2026-07-05T07:51:04Z","snapshot_observed_at":"2026-08-04T19:11:48.797552Z","submitted_at":"2023-12-21T11:52:45Z","title":"AppAgent: Multimodal Agents as Smartphone Users","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13771","snapshot_observed_at":"2026-08-06T17:18:14.165736Z","title":"Appagent: Multimodal agents as smartphone users","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.165736Z"},"links":{"cited_paper":"/paper/2312.13771","citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:b43c602272ffe7ce711e9a128c10565930657b59e4e532b43cae9acbf824e74b","observation_id":"c51e1a3b-11e9-4557-aa96-26c9f73191b1","resolution":{"observed_at":"2026-08-06T17:18:14.165736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:16.639311Z","title":"Visually-prompted language model for fine-grained scene graph generation in an open world","venue":null,"work_id":"af691203-e3e2-4e67-9e79-42bad5df7ae7","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.205944Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:65a210ca141012f355125313da73ecd75201f843d297070f2c55aeb5955fd85b","observation_id":"7285a952-e166-495d-96f7-3e13a0c27a45","resolution":{"observed_at":"2026-08-06T17:18:16.729026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:16.453690Z","title":"Visual programming for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":"ae6c4d1b-9c59-46dd-b3fc-bda3d693782a","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.295905Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:7095ae44640f960991bdfb0f79189060dbeeb408eda67bc52d783d41920efff9","observation_id":"50924109-6dab-4f3e-b74f-a1aaabe18993","resolution":{"observed_at":"2026-08-06T17:18:16.560839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:16.228712Z","title":"Multi3drefer: Grounding text description to multiple 3d ob- jects","venue":null,"work_id":"f6cfa782-ac56-4db6-928a-fdc3c7ca1d64","year":2023},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.401402Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:39dad95f63ed17961b90b2c76a8db48671e0fe1eee9707ebca75a40364974498","observation_id":"0d2a8417-3822-4740-b6da-d5ad400d68f9","resolution":{"observed_at":"2026-08-06T17:18:16.325888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:16.043043Z","title":"Towards clip-driven language-free 3d visual grounding via 2d-3d relational en- hancement and consistency","venue":null,"work_id":"a8ba530e-5cd0-4d59-b26b-c2b6619af766","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.470853Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:fe6213473e5d006aeac37b18e2988fc87f78f94b451eebe1c839417cf3891a9a","observation_id":"d7249bfb-ba41-47a9-91ba-e54441ddf6c2","resolution":{"observed_at":"2026-08-06T17:18:16.133141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:15.888082Z","title":"3dvg- transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":"df3154d7-35a9-44dd-87db-686c0ed1f8fd","year":2021},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.561773Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:a53749c777b8444230c563d808374307b9b3cd171b3c9c477823a3ec58d88382","observation_id":"4fe4caae-2393-4b23-ac9e-4e82e6bb8ea6","resolution":{"observed_at":"2026-08-06T17:18:15.958457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:15.677437Z","title":"Recdreamer: Consistent text-to-3d generation via uniform score distillation","venue":null,"work_id":"de565996-f44f-45fc-b84d-9bf94b0a6662","year":null},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.688627Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:80277418692059fae7e561c0683fff52b9bc8eb3f9deeb2e1cb06462212e0973","observation_id":"b2d39ab7-26b5-4deb-b54a-4aa8bcd4585e","resolution":{"observed_at":"2026-08-06T17:18:15.769685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:15.474400Z","title":"Learning an interpretable stylized subspace for 3d-aware animatable artforms","venue":null,"work_id":"aef3dff1-c36f-4961-b84f-f939ef2b12f2","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.768209Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:4a862d31b1b98c26e815c26ff2b447c06656080040849c3a95c5905b9cef8b92","observation_id":"0f8264bd-dc26-47cd-bb8e-d9ba862e5af3","resolution":{"observed_at":"2026-08-06T17:18:15.560384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:15.286707Z","title":"Navgpt: Explicit reasoning in vision-and-language navigation with large lan- guage models","venue":null,"work_id":"14c2c995-a09f-49be-a604-4130b62768ae","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.861449Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:301fe0657b3222600926e666ac5ea1065532b8292c19a4dd73e7caa78bae5522","observation_id":"24fadd34-555f-417a-b47b-443df573e8d0","resolution":{"observed_at":"2026-08-06T17:18:15.365406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:18:15.071877Z","title":"Unifying 3d vision-language understanding via prompt- able queries","venue":null,"work_id":"5737a059-06fb-477c-a8f1-5b7ae57a3d16","year":2024},"citing_paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:14.922481Z"},"links":{"citing_paper":"/paper/2507.11261"},"observation_digest":"sha256:92a5e58dbd65da95f881b14ddd58791aff90a54eef2e3b5de56e972d60ae6af4","observation_id":"39697c49-7872-4fd2-bc57-0ee034b57ec5","resolution":{"observed_at":"2026-08-06T17:18:15.154024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.11261","last_updated":"2025-07-27T06:20:54Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:03:47.024580Z","submitted_at":"2025-07-15T12:35:01Z","title":"ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2507.11261."}