{"as_of":"2026-08-20T14:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34b3bb0431803fa8ed069be783fe9b511466758af53cd6e2148de1f487da4794","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:23:32.681263Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.14238/citation-record","integrity":"/paper/2506.14238/integrity","json":"/paper/2506.14238/citation-record.json","paper":"/paper/2506.14238"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:27.128324Z","title":"Return to antikythera: Multi-session SLAM based AUV mapping of a first century B.C. wreck site,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:27.128324Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:b59d08a01fcfe3c93e02243116d24965331f566853566c47f12edb076258cea0","observation_id":"96e4ef86-19fa-4598-9113-b8f7020703a7","resolution":{"observed_at":"2026-08-07T00:23:27.128324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.81222","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:33.456915Z","title":"Towards subjective quality assessment of point cloud imaging in augmented reality,","venue":null,"work_id":"bfe37e95-aa04-4090-9357-d308f65ef486","year":2017},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:27.260598Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:6353ae8d44decc63fe8523fb900a1058bc3bebf9041e9288a77e196931ea3ffe","observation_id":"d8a5d561-0e89-41a6-a015-e33a8b2b0b36","resolution":{"observed_at":"2026-08-07T00:23:33.595020Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:27.419025Z","title":"Deep hough voting for 3d object detection in point clouds,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:27.419025Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:ca520ad3b29d245e108bb362e857506c4d71f245c6c1b0b89e11c9bd882992d9","observation_id":"9865cad1-a139-4f39-980a-a6c26b25d9bb","resolution":{"observed_at":"2026-08-07T00:23:27.419025Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:41.239282Z","title":"Het- erogeneous network crawling: Reaching target nodes by motif-guided navigation,","venue":null,"work_id":"58d0acbc-1ec5-4f14-94dd-0d83b849597d","year":2020},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:27.657220Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:e904fc21569898c2bbb6538ce60566b0563b42405b5bb9609255aaae0d18bd74","observation_id":"119dabe7-016c-42b5-96c6-7e3d37d2054f","resolution":{"observed_at":"2026-08-07T00:23:41.363648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:41.077203Z","title":"Continuous trajectory similarity search for online outlier detection,","venue":null,"work_id":"a277e32a-2450-44f3-b91c-1f4bc72f3a50","year":2020},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:27.807667Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:0c6c49fb2050328ee5488f99f0c0589976c9d8ce259493d768733df3a0d17d17","observation_id":"3842dff3-e94d-46ee-bb92-ed03f2031601","resolution":{"observed_at":"2026-08-07T00:23:41.157568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:40.880488Z","title":"A human-computer interactive method for projected clustering,","venue":null,"work_id":"4581f537-fd9d-43e8-9201-169e7a74eb35","year":2004},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:27.948670Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:06d53c15fb1be3db1bb6c77e7b44ebaabb2a12869ae5442cea1c92e0ee95a9a0","observation_id":"4b53eaf0-c94a-44e4-b87e-01332174282e","resolution":{"observed_at":"2026-08-07T00:23:40.968231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:40.539278Z","title":"Tree-based mining for discovering patterns of human interaction in meetings,","venue":null,"work_id":"40eff073-b398-483c-93ff-254ff3c463d4","year":2010},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:28.089856Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:c352227fe3f16bee49835ca4e2bcf035bd2e64aa4146ef6242808928749a21e8","observation_id":"3b0b545c-0a3e-42ca-860f-87a3c190c634","resolution":{"observed_at":"2026-08-07T00:23:40.740743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:40.291365Z","title":"Scanrefer: 3d object local- ization in rgb-d scans using natural language,","venue":null,"work_id":"806767e8-3bd9-4220-8087-7e208caaa4de","year":2020},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:28.221905Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:6f7fc813a9546f5d5492f1fa4595964d07819d8c1018c8b9942b3131129e3d6a","observation_id":"5a5209d8-396b-49ea-9969-6941d75054c6","resolution":{"observed_at":"2026-08-07T00:23:40.407307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:28.372326Z","title":"3dvg-transformer: Relation modeling for visual grounding on point clouds,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:28.372326Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:a47b610c178fec3726c95c603880cb8350223eb98343166bf36fe2e98fadd340","observation_id":"1d5c41b7-c339-4e85-8732-73f631cf8361","resolution":{"observed_at":"2026-08-07T00:23:28.372326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:40.043812Z","title":"Sat: 2d semantics assisted training for 3d visual grounding,","venue":null,"work_id":"30d936c8-1066-410c-b1a0-803d32082c52","year":2021},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:28.513899Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:2afd342ea34ec51b758af98614f73e70bf04c4e3d65d9c33d253122761d4ffd5","observation_id":"44f18a84-e948-41df-8c35-23180f17ba75","resolution":{"observed_at":"2026-08-07T00:23:40.165054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:39.845153Z","title":"3d-sps: Single-stage 3d visual grounding via referred point progressive selection,","venue":null,"work_id":"59220b9b-4c5a-4762-84a1-47ea946ff1b6","year":2022},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:28.620925Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:e5750a9e9ff65397cb243758332b6b084b67f6a770c2b4e2acb7d05b06fdf914","observation_id":"e4dbff0a-9749-4ed0-91eb-3a247016a723","resolution":{"observed_at":"2026-08-07T00:23:39.927959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:39.637067Z","title":"Viewpoint-aware visual grounding in 3d scenes,","venue":null,"work_id":"1b1081e4-ba39-44ce-8828-4f6470fe59d9","year":2024},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:28.727211Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:dfbe0c69d2b607b7df5307c9db7a8964d2935d882d632aaf6bfc2dfdf9a56bbd","observation_id":"87e4f1c1-f884-482c-a9a8-5668a9387f51","resolution":{"observed_at":"2026-08-07T00:23:39.720083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:39.419705Z","title":"Eda: Explicit text-decoupling and dense alignment for 3d visual grounding,","venue":null,"work_id":"8b5b35e7-bc92-4139-b187-fe54794e4b80","year":2023},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:28.889123Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:d47d32ee92654b5d7a488ea881da4d76f49e216a83822be63d0f896d8ef00896","observation_id":"f34606df-0dc8-4e92-893c-51d5e3dddf9c","resolution":{"observed_at":"2026-08-07T00:23:39.521383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:39.168184Z","title":"Scan2cap: Context-aware dense captioning in RGB-D scans,","venue":null,"work_id":"23f85fcd-ce56-4830-8f97-cd51805c1ada","year":2021},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:29.063160Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:60b2d6d805dbcbad74d9e224546d195bb16f15d76018c9075e69caa9a846c1fe","observation_id":"753eeac6-cfcf-470f-9607-43b14d0d0a41","resolution":{"observed_at":"2026-08-07T00:23:39.299893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:38.835164Z","title":"X- trans2cap: Cross-modal knowledge transfer using transformer for 3d dense captioning,","venue":null,"work_id":"290d70ea-30a2-43b6-84da-85d8a912ca78","year":2022},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:29.278917Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:9c18b043abe360a704e282a0c974a98540ccc43c0420cb002ef90bde001dd928","observation_id":"1dad841e-d6ad-4931-8568-29e5ecaaa56e","resolution":{"observed_at":"2026-08-07T00:23:38.990379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:38.486991Z","title":"End-to-end 3d dense captioning with vote2cap-detr,","venue":null,"work_id":"9628b4b8-bbdb-462b-aaff-cbb4ba031062","year":2023},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:29.393360Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:a78a1bc24ad05ce9bfe850a68b6497d2adc8c5e4fe9517f2c1dee7acd560712f","observation_id":"4232bd95-cff6-48c7-afac-518e7f5f3dd1","resolution":{"observed_at":"2026-08-07T00:23:38.647332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:38.183205Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes,","venue":null,"work_id":"37f6e95b-cae6-4234-acd9-b954dfa43b55","year":2020},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:29.523723Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:d1884fe4697b38e50e283ec374b8f330d7660e9e2cf49a3b5335390cbf74b167","observation_id":"6c960f7b-3dd7-43d3-bfcd-1596730ad82d","resolution":{"observed_at":"2026-08-07T00:23:38.319215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:37.796069Z","title":"Bottom up top down detection transformers for language grounding in images and point clouds,","venue":null,"work_id":"d7ef9961-aa57-40a4-b43a-efacafe28277","year":2022},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:29.686469Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:ee9123d47d8aad07f9fd48a13165df08b4fe84ab07f0eecaf384531d7e728648","observation_id":"6c60b892-71e6-49e5-9fd1-aaa4d4260ebb","resolution":{"observed_at":"2026-08-07T00:23:37.962459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:37.558882Z","title":"Scanqa: 3d question answering for spatial scene understanding,","venue":null,"work_id":"e80534c3-de02-4fbd-8d44-ca0336d5d1e3","year":2022},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:29.812938Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:95cbcd2080d330bd1c3294ddc4331ef856a7c2308bc4b15e6b3ad2a5d81e7bfb","observation_id":"d6d4a67c-38a4-4b4b-a38a-5d5cc499ca58","resolution":{"observed_at":"2026-08-07T00:23:37.666633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:37.201292Z","title":"SQA3D: situated question answering in 3d scenes,","venue":null,"work_id":"857ef92b-c028-472d-9beb-3faf43dc48f7","year":2023},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:29.951341Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:79190847e456bfab4458bc7bf3f2940a874b82711002eb765d48ea3fb35c6541","observation_id":"c69274e0-2423-4e94-a8e9-b88e90478439","resolution":{"observed_at":"2026-08-07T00:23:37.380083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:36.731989Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes,","venue":null,"work_id":"67c19059-7f0c-4305-9d1b-cbd0a21971db","year":2017},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:30.128835Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:1e9144b77f54e1fca95d44d1de07dbfd23d11c5600eb266870f5c45267bb24c4","observation_id":"83ad4e7d-fdff-4af0-ab79-e98624b32443","resolution":{"observed_at":"2026-08-07T00:23:36.907744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:30.320573Z","title":"Multi-view transformer for 3d visual grounding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:30.320573Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:5cec5c8d0a6e13a035c23f3c11d7a212cf7b781c97ca757b3f9022e3995512c3","observation_id":"cdb46604-bb78-4b81-a5dc-61b05184954a","resolution":{"observed_at":"2026-08-07T00:23:30.320573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08182","last_updated":"2024-03-13T02:11:04Z","snapshot_observed_at":"2026-08-16T14:10:21.749294Z","submitted_at":"2024-03-13T02:11:04Z","title":"SeCG: Semantic-Enhanced 3D Visual Grounding via Cross-modal Graph Attention","version":1},"cited_work":{"arxiv_id":"2403.08182","doi":"10.48550/arxiv.2403.08182","metadata_source":"pith","pith_arxiv_id":"2403.08182","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"SeCG: Semantic-Enhanced 3D Visual Grounding via Cross-modal Graph Attention","venue":"cs.CV","work_id":"6d7032f7-5b9b-4ae0-abf8-a32ac41b7de2","year":2024},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:30.451084Z"},"links":{"cited_paper":"/paper/2403.08182","citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:2c7eed81ce83161c63ee6ead2039a746ea0feb44c73adb468dd3d2f35364630e","observation_id":"86097fb4-889c-4e3a-bfcd-462475ae6804","resolution":{"observed_at":"2026-08-07T00:23:32.995741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13363","last_updated":"2023-07-25T09:33:25Z","snapshot_observed_at":"2026-08-16T15:13:30.804357Z","submitted_at":"2023-07-25T09:33:25Z","title":"3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13363","snapshot_observed_at":"2026-08-07T00:23:30.595370Z","title":"3drp-net: 3d relative position-aware network for 3d visual grounding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:30.595370Z"},"links":{"cited_paper":"/paper/2307.13363","citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:dbae9b38cb721b5f1c32074c63225910876c75327e67f5f88c98753bd134ccf5","observation_id":"55b757a7-6748-4cae-a24d-1f396766ed3a","resolution":{"observed_at":"2026-08-07T00:23:30.595370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:30.706563Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:30.706563Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:7f1cb3bb89c18f8edc495de5ada8d007ad07e72e298bcbcf889ebcdec3ff6a82","observation_id":"6544b403-9688-4387-a199-a52d8fb5bf74","resolution":{"observed_at":"2026-08-07T00:23:30.706563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:36.462142Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":"a7824375-e437-4701-abb7-a78a4992c284","year":2021},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:30.745162Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:119fc9eae3c25906b4f4345eae59d958d366b8f937d7fa0416c6b00cc52da028","observation_id":"d0815769-f103-4f08-8a1f-1dee5d66d676","resolution":{"observed_at":"2026-08-07T00:23:36.597041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T00:23:30.810463Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:30.810463Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:127a05ef9967e86ad7c071f34c0b9d9545c53116fbd03b3dd4df05ab725065dc","observation_id":"cda27c53-6664-4c43-8d9c-719ec28d1452","resolution":{"observed_at":"2026-08-07T00:23:30.810463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:30.877195Z","title":"Pointnet: Deep learning on point sets for 3d classification and segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:30.877195Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:0464575d1f3beca84931322d84d13a3426d6fff90de3adedcd5f4e3cebc12360","observation_id":"dab09e0c-56d4-4212-be59-30c2199f9187","resolution":{"observed_at":"2026-08-07T00:23:30.877195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:36.120381Z","title":"Group-free 3d object detection via transformers,","venue":null,"work_id":"0d8f3f59-29f8-472d-bc4c-11df233d0a19","year":2021},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:30.994611Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:44e31d7dc190f111b2aa398cd4a8d1d752453f623da94979d273c6d3c17fda8f","observation_id":"0810e150-c95c-4135-8d99-a0ec869f216b","resolution":{"observed_at":"2026-08-07T00:23:36.292284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:35.840512Z","title":"Epcl: Frozen clip transformer is an efficient point cloud encoder,","venue":null,"work_id":"8989159d-d9bb-4e8a-866f-2cc1360e516f","year":2022},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:31.139334Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:c6c9c8513725fa35ff2773b419731629c4e776a297382119bca0fa163550dad9","observation_id":"8d95ba74-0ba8-4589-b108-0ac3972e3f9b","resolution":{"observed_at":"2026-08-07T00:23:35.961185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:35.489526Z","title":"P-tuning v2: Prompt tuning can be comparable to fine-tuning universally across scales and tasks,","venue":null,"work_id":"29a1b543-ef52-4920-ba02-c9293e4a182a","year":2021},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:31.335827Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:b99e8ed79c57017944f283cc17dabf9bf65b4f187796b34d47735b52c930ff3e","observation_id":"ed0f7c74-789a-41f5-8ddd-3179c6fe12ec","resolution":{"observed_at":"2026-08-07T00:23:35.673473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:35.174216Z","title":"Contrastive learning for weakly supervised phrase grounding,","venue":null,"work_id":"e1674545-4e02-48f4-86f6-f906c95dd8f1","year":2020},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:31.482806Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:e77b3f53428e197f52b744d2b7b6628f29406e0f93a56fbd372b040f7b5205b0","observation_id":"360b7f35-084f-4eaa-9dc8-24a97b8cc1c6","resolution":{"observed_at":"2026-08-07T00:23:35.265750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:31.625589Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:31.625589Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:85c5accdbc048724a91cf14941eb165b680df8f9a3e9b9a34b1d7d79b5e31ee0","observation_id":"b9647c0a-b0c1-4ec4-a33f-27652f7f2af5","resolution":{"observed_at":"2026-08-07T00:23:31.625589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-08-19T16:02:58.628969Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-07T00:23:31.773278Z","title":"Grounding dino: Marrying dino with grounded pre- training for open-set object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:31.773278Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:246379cb2c018d2b7c689df04d42306cb49c98d7e8224a42902b898e49c89a43","observation_id":"be3fe4ee-af98-4bb8-ba75-c6fdb985ba6c","resolution":{"observed_at":"2026-08-07T00:23:31.773278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:34.819635Z","title":"Text-guided graph neural networks for referring 3d instance segmentation,","venue":null,"work_id":"a88f7155-be71-433a-b485-79c7afbafbda","year":2021},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:31.949567Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:dc953af33b803fd679d243edc06f08a12e41915457af673d2b9c7fb65152d327","observation_id":"39994d03-b449-4e36-b1b4-bf401395e794","resolution":{"observed_at":"2026-08-07T00:23:34.955282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:34.482171Z","title":"Instancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual referring,","venue":null,"work_id":"8c1cbddd-5b0a-48b9-8a92-f10e9ad57d63","year":2021},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:32.129697Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:3c9c4abca00828a412aee4c3c51274f13ddba7f745160d351c90813fcba63225","observation_id":"0624b1e0-e088-47f5-9e5a-f918d7413f7a","resolution":{"observed_at":"2026-08-07T00:23:34.651968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:34.258302Z","title":"Free-form description guided 3d visual graph network for object grounding in point cloud,","venue":null,"work_id":"aef4bf9f-e5ed-4314-8dae-1079e7de9989","year":2021},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:32.291286Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:99d3259a9d6689981b5b358dcfa2a1ea9f1a1d65d731867f1d0f9ce79e8c355d","observation_id":"ee427d66-4737-4d0b-80bf-21606acb3d69","resolution":{"observed_at":"2026-08-07T00:23:34.358974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:34.027184Z","title":"Language conditioned spatial relation reasoning for 3d object grounding,","venue":null,"work_id":"54b3607f-888c-451e-a817-5ec7cdc47664","year":2022},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:32.496978Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:da054ee46bc18ac1e018f74c50e82be2538cc505f700447b73e09c8ceb76b411","observation_id":"16dd6043-e2fb-46a6-9bf7-da8e26e63d19","resolution":{"observed_at":"2026-08-07T00:23:34.151611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:23:33.700437Z","title":"Viewrefer: Grasp the multi-view knowledge for 3d visual grounding,","venue":null,"work_id":"721a9299-b600-4471-8e93-fa2557ecd493","year":2023},"citing_paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:32.681263Z"},"links":{"citing_paper":"/paper/2506.14238"},"observation_digest":"sha256:0a6524987e145efecb232c4335a77eab2fc165d7abee01a5a152495a65e7992b","observation_id":"a051fa8a-4ab8-4318-afc4-398a4c0a6a03","resolution":{"observed_at":"2026-08-07T00:23:33.874341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14238","last_updated":"2025-06-17T06:53:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:15:52.224174Z","submitted_at":"2025-06-17T06:53:15Z","title":"Unified Representation Space for 3D Visual Grounding"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2506.14238."}