{"as_of":"2026-08-13T10:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b12f510923e5a38ea2b81e3ff6bc8c2390f67f5c07326461a6063c45748f5a9f","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:52:39.192613Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.19774/citation-record","integrity":"/paper/2411.19774/integrity","json":"/paper/2411.19774/citation-record.json","paper":"/paper/2411.19774"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.941285Z","title":"Referit3d: Neural listeners for fine-grained 3d object identifica- tion in real-world scenes","venue":null,"work_id":"51f7b687-1ed8-4731-b369-d03279c03a0a","year":2020},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.938936Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:8aad488a665317cb6e6afe8f1e91305450ac640aca2b3da06003892f1f0bd7e4","observation_id":"2fdef48d-5f20-42c6-9041-6b882d02dc27","resolution":{"observed_at":"2026-08-12T05:52:39.944984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.930942Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"fcd7fe91-4fa8-4ef6-8e90-23fd3dc1474d","year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.943249Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:df2cab9aa0787b25d4fc6ddc89c969708f2261301e8eebf8efa69922bfc6d6c0","observation_id":"3bebe37e-82b0-458e-9d5b-fd164d7c3d56","resolution":{"observed_at":"2026-08-12T05:52:39.934549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.921082Z","title":"Meteor: An auto- matic metric for mt evaluation with improved correla- tion with human judgments","venue":null,"work_id":"9fd0b5c5-b80b-4777-a260-9f70ff2d2f5c","year":2005},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.947196Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:d776d97f2add1fdd779ba261ade51f388f7ecb79ca16f046010b8a8804ec9e1c","observation_id":"bb45f7f3-7aec-4012-a808-f33480cb1ca3","resolution":{"observed_at":"2026-08-12T05:52:39.924604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.909922Z","title":"3djcg: A unified framework for joint dense captioning and visual grounding on 3d point clouds","venue":null,"work_id":"631eedff-7562-4b70-be99-1c3acf67125e","year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.950783Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:29ee8fcade111a27cd5e36dd9ed21d0fe4219cea69d3115161e1728e36da0904","observation_id":"8a53a480-00f6-49fd-8998-0964fecd4442","resolution":{"observed_at":"2026-08-12T05:52:39.913830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.899011Z","title":"Crossvit: Cross-attention multi-scale vision transformer for image classification","venue":null,"work_id":"a1db8846-65da-4276-a64d-d6bb0cbe4f28","year":2021},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.954620Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:4f2bef6f5dc22c14268e58a8ccf0b6645f393bc86cb2c6bbf394d7f5f269e015","observation_id":"a49fbc68-bb7d-451c-a990-167299085c21","resolution":{"observed_at":"2026-08-12T05:52:39.902928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.887966Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"3e254199-a5a3-40c8-bbd9-3023bcfe937a","year":2020},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.958348Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:2247be4c913ff2c4024d6bf5eee057324847aa8852b2961786c5c65764d23423","observation_id":"8cda7a66-f998-4172-8efe-ca1019a04bb4","resolution":{"observed_at":"2026-08-12T05:52:39.892113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.877580Z","title":"D 3 net: A unified speaker-listener ar- chitecture for 3d dense captioning and visual ground- ing","venue":null,"work_id":"2b356c5b-27e8-4faf-8a5e-ed27735ad6f8","year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.962291Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:7783a0c3b7aa3cf5cbde08a399b3cafefa81ed5c3e6b21490ad24ccdba57ca65","observation_id":"0800104a-0af8-4cf3-bd6d-325df1be3d9f","resolution":{"observed_at":"2026-08-12T05:52:39.881384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.866797Z","title":"End-to-end 3d dense cap- tioning with vote2cap-detr","venue":null,"work_id":"2ca0dc57-1761-442f-a048-3dd76c8c414a","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.965800Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:c3e2f6325e0c479ac37b5b4b56247361d0dad70ab1cd31dfae6560d2b6320657","observation_id":"66aca1ab-2e86-4b8c-a7af-42b6151a4a70","resolution":{"observed_at":"2026-08-12T05:52:39.870834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.856112Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":"6890e37c-9ad2-476c-be0e-636ca0091e62","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.969235Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:559d3856ddaa4c3c16cc73d0f4dc7f0b0f6440de88fc1e656f33a0594c3b6d05","observation_id":"d0f43706-c372-4761-b5c9-52ac5cd1f4d3","resolution":{"observed_at":"2026-08-12T05:52:39.859987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.845663Z","title":"V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning","venue":null,"work_id":"a84fa6b6-7547-4cd7-8609-b5f9f8a202ce","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.972590Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:8d9b4f78e3d02640e9d915f8d591f5f3215d227e6e5a1fb11038d25fac286acd","observation_id":"3955fffe-6cfc-4c27-98a5-b1de0a5d3a0c","resolution":{"observed_at":"2026-08-12T05:52:39.849423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-13T00:05:34.358839Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-12T05:52:38.976162Z","title":"Grounded 3d-llm with referent tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.976162Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:5d00ff1bcb5f293244e682531be8aff03e99067be78a1de6703dd40b1db54262","observation_id":"44351e42-213b-4930-9f53-61b35932920f","resolution":{"observed_at":"2026-08-12T05:52:38.976162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.834888Z","title":"Scan2cap: Context-aware dense cap- tioning in rgb-d scans","venue":null,"work_id":"ca67f58e-55b3-4819-99ee-bbd5b3260830","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.979952Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:0d72e628731f86a8f330a3018f02849995a32a5dd52f2ab0863eed8507c7a3be","observation_id":"8175b21e-dfb2-46dc-9ed8-2231d0e84214","resolution":{"observed_at":"2026-08-12T05:52:39.838963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.824492Z","title":"Unit3d: A unified trans- former for 3d dense captioning and visual grounding","venue":null,"work_id":"283410bb-bc62-4d97-8bc5-017394f4350e","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.983424Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:04f3f54a8640a1e396ae546f246641a003f3d918767d12830091acb13d8e1cb1","observation_id":"dcb88bb0-83f2-4c5a-b6ac-782f68f0c198","resolution":{"observed_at":"2026-08-12T05:52:39.828144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.814574Z","title":"Scannet: Richly-annotated 3d reconstructions of in- door scenes","venue":null,"work_id":"8bbead59-95ee-497c-8a33-2600aff47baf","year":2017},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.986856Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:33a188b39e614a106ca36bf5a40e116211549eae869246af268b4cb78ea6e10d","observation_id":"77a116e8-9795-4a95-9853-910c70b5fb65","resolution":{"observed_at":"2026-08-12T05:52:39.818310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.804009Z","title":"Objaverse-xl: A universe of 10m+ 3d objects","venue":null,"work_id":"bd3c7364-89f2-4c61-8bac-97464051da94","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.990422Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:7d17bbdab556c389d5bf067ef58bd10c224746da2bcdaee357cf5aaa697ef839","observation_id":"7c51650b-4d5d-4875-a615-f374a3d992c9","resolution":{"observed_at":"2026-08-12T05:52:39.807865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02329","last_updated":"2023-06-04T11:08:53Z","snapshot_observed_at":"2026-08-04T06:06:16.303733Z","submitted_at":"2023-06-04T11:08:53Z","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02329","snapshot_observed_at":"2026-08-12T05:52:38.993892Z","title":"Multi-clip: Contrastive vision-language pre-training for ques- tion answering tasks in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.993892Z"},"links":{"cited_paper":"/paper/2306.02329","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:b9b1a627a3a292d696eb96024b07f35d63a40d6f0873b2f27b6d215621b7bb8a","observation_id":"20f75eea-3e90-4471-8d06-ff8dfebe86f7","resolution":{"observed_at":"2026-08-12T05:52:38.993892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-13T00:33:57.647386Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-12T05:52:38.997621Z","title":"Internlm-xcomposer2-4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:38.997621Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:3bacbd931c18e158df3c0d66e1c76522ac5625c86a22cd6eec27f846522e2c5b","observation_id":"1cee78a3-7d4d-43d4-84b0-098dcfe36cea","resolution":{"observed_at":"2026-08-12T05:52:38.997621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.793652Z","title":"Multiscale vision transformers","venue":null,"work_id":"9a7828f1-5c1b-45ab-9282-652a50f96c6f","year":2021},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.001966Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:2602e747b4630db449fd4a0d6d6db41a4bf7f28b73829e493a6627ba0654899e","observation_id":"1c64239b-3558-4e70-9452-ebe4c70cd557","resolution":{"observed_at":"2026-08-12T05:52:39.797271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-13T00:52:19.292622Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-12T05:52:39.005828Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.005828Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:ff9195be62d3017c359d2715e659284bf2f713328731cd4273f22624adb8aa97","observation_id":"dcb1099d-23f2-440c-b66f-07e9a055757d","resolution":{"observed_at":"2026-08-12T05:52:39.005828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01915","last_updated":"2024-07-21T02:33:00Z","snapshot_observed_at":"2026-08-13T04:04:12.356910Z","submitted_at":"2024-03-04T10:29:58Z","title":"xT: Nested Tokenization for Larger Context in Large Images","version":2},"cited_work":{"arxiv_id":"2403.01915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01915","snapshot_observed_at":"2026-08-12T05:52:39.358960Z","title":"xT: Nested Tokenization for Larger Context in Large Images","venue":"cs.CV","work_id":"5c5845f1-43d2-4635-8612-1952b7a28358","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.010013Z"},"links":{"cited_paper":"/paper/2403.01915","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:3a7d792b21e80739d60d18d6948a877f6152019111f98dada491478427c2b2e3","observation_id":"9b5a0750-59d2-4b0e-aa30-2e993309828a","resolution":{"observed_at":"2026-08-12T05:52:39.364839Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.783121Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":"0cc54047-176d-4f6f-8619-5991f51bb51b","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.013879Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:1890008cdd438f3837da701283951e2ac6e048dbecb5176403443ad602c03956","observation_id":"8eb461bf-9546-4d5c-a114-7a3cf0b6e4d6","resolution":{"observed_at":"2026-08-12T05:52:39.786891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.772646Z","title":"Chat-scene: Bridging 3d scene and large language models with ob- ject identifiers","venue":null,"work_id":"d4eac773-1175-4e05-8670-6e3096d4c423","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.017450Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:ad61e91b9e46a5e0471da172c2dd168ef5c76c0c99ef25eb7a9ddb5b71b01861","observation_id":"3e922793-cc5d-4169-aefe-844f1b3f0929","resolution":{"observed_at":"2026-08-12T05:52:39.776412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.761731Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"423e20ab-9837-4724-87ac-42e92ffe68fb","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.020975Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:487e8b7039f7be2afe2b291e5b37ebfdf8e01adfb56993b019be803c340e975b","observation_id":"d68c1c9b-43a4-4cda-8fa0-b27a92065887","resolution":{"observed_at":"2026-08-12T05:52:39.765509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.750463Z","title":"Segment3d: Learning fine- grained class-agnostic 3d segmentation without man- ual labels","venue":null,"work_id":"e32aca8c-fab7-4758-a249-c56147481808","year":2025},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.024652Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:2e96171e948374a8d5da12e8b5fa6f7838b42e97d4fb701b1bde40843bd71503","observation_id":"ae33bd7e-9c1e-4a22-89ab-e0bcf6165772","resolution":{"observed_at":"2026-08-12T05:52:39.754704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.738633Z","title":"More: Multi-order re- lation mining for dense captioning in 3d scenes","venue":null,"work_id":"987390d5-a023-4415-af2e-db2b4a2befa4","year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.028167Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:4f4a3a7c1a3b051702db2e94072e84db9331cd2cc42727de3cdae77dcdd47784","observation_id":"c98a4fc8-5406-4f84-9f98-44752e058333","resolution":{"observed_at":"2026-08-12T05:52:39.742845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.727188Z","title":"Context-aware alignment and mutual masking for 3d-language pre-training","venue":null,"work_id":"0e0b0dab-25eb-422c-a660-3568ee77f294","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.031490Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:2ad367890f1d6816b4839ac0e77db32454ae45cd83e00f21326956fee102a65c","observation_id":"b34aa670-eaef-4be8-8fab-0fcf73de1781","resolution":{"observed_at":"2026-08-12T05:52:39.731167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.716439Z","title":"Large-scale point cloud semantic segmentation with superpoint graphs","venue":null,"work_id":"5f1b2881-a1a4-4a16-8307-24b614cda6f4","year":2018},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.035631Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:c1d4861d411d3ab404feb8f980aeb24adc7a67fff858c9ef96c3cb30f0ef0890","observation_id":"b2427f95-ecda-4bf1-878a-97278b10069a","resolution":{"observed_at":"2026-08-12T05:52:39.720618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.705468Z","title":"What matters when building vision- language models? Advances in Neural Information Processing Systems, 37:87874–87907, 2024","venue":null,"work_id":"2dcb3b8d-cfba-46bb-ad3d-e3510a1cb0c7","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.039121Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:c5c6f97b8d70a45bea8fb4bf576f9de93f6f287e6e5bf05bf9dd435608f8476e","observation_id":"166bf56f-6f62-4a96-ada1-10aac79273bc","resolution":{"observed_at":"2026-08-12T05:52:39.709339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.694397Z","title":"Mpvit: Multi-path vision transformer for dense prediction","venue":null,"work_id":"c992df20-b5eb-4c09-be53-b735229e2612","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.042900Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:4a1e337958ffafc3fcb2ec7838349cfff490b57b7a811450cc76a7520f99c6f9","observation_id":"3815e453-0e7b-404d-ab9d-14b4c1769f7e","resolution":{"observed_at":"2026-08-12T05:52:39.698170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T05:52:39.046581Z","title":"Llava-onevision: Easy vi- sual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.046581Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:ff9b2cc0b430225d2299f5b7200b6005805fd3f99459ac87feca232bc330e143","observation_id":"891c454f-9b63-464e-9058-c3e6766c5b25","resolution":{"observed_at":"2026-08-12T05:52:39.046581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.683384Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large lan- guage models","venue":null,"work_id":"371ba1e1-792b-4935-9d9e-72477c3a8f0f","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.050351Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:a595f6fc7718afe784fc23119f80afad3225de22e2572b45fdd0317ce16f5c8b","observation_id":"5f2d3968-9c56-464a-b206-6c96a7d7c085","resolution":{"observed_at":"2026-08-12T05:52:39.687251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-12T05:52:39.053889Z","title":"Mini-gemini: Mining the poten- tial of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.053889Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:3307e67bd49a1eb23411e3d6865cc36e6989b84e00580f14a634dd4dac3e500f","observation_id":"57ab0e17-348f-4018-a13d-42fe18eee0b9","resolution":{"observed_at":"2026-08-12T05:52:39.053889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.673286Z","title":"Pointmamba: A simple state space model for point cloud analysis","venue":null,"work_id":"64e544e9-1696-4221-bbf0-67ad3911f477","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.057577Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:4dc715ccb36aa027d5be1a10e3ff5a345445b3c138fafece74565e59e6b424a8","observation_id":"07ed28d0-d96c-4824-8cd9-a0066e3d7fb1","resolution":{"observed_at":"2026-08-12T05:52:39.676839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.663359Z","title":"Rouge: A package for automatic eval- uation of summaries","venue":null,"work_id":"12b8c3a0-56ee-498f-badf-fb7d7aa55329","year":2004},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.061002Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:568b21fb7ab6bd9afae7d230031e460716fb6c52e46b03710ee8526adcd8bef9","observation_id":"862269ea-21f2-400d-bc38-ae9a7e357a86","resolution":{"observed_at":"2026-08-12T05:52:39.666919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.652983Z","title":"Llava- next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":"36187371-9a85-45cf-80b7-ab18164c134b","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.064701Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:f52c7757a0d75d10e1de6cbfb2be3c6888b63b5ef1e286697bbfc568a4166a63","observation_id":"49c48ae7-fbda-4c96-afc6-fe2df78fc7b8","resolution":{"observed_at":"2026-08-12T05:52:39.656619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.068119Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.068119Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:34ab7d999c674610a1fb9a06b518b3d4f19dfdfd40e59ea875863a4b7c77f8e0","observation_id":"45e634a6-c7be-4f87-af45-2ffa100af226","resolution":{"observed_at":"2026-08-12T05:52:39.068119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.636570Z","title":"A convnet for the 2020s","venue":null,"work_id":"fd31aaed-fbb7-45a3-87c9-cdfe727afbf5","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.071426Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:bb100f2ac5558ee4b7af6424909443348df7976992cd9352d648b06c372cb433","observation_id":"a3681f95-181e-4ec4-b95e-44c8ee7c47fc","resolution":{"observed_at":"2026-08-12T05:52:39.640650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T05:52:39.074951Z","title":"Fixing weight decay regularization in adam","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.074951Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:fe7456cb18eb3140b18fb889e0edb7ea90822f0654205f16e6cad8cc51bc8069","observation_id":"22d1efa9-ccbe-4580-afa0-82081e8d86eb","resolution":{"observed_at":"2026-08-12T05:52:39.074951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-11T02:19:20.093098Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-12T05:52:39.078828Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.078828Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:bd130f4b0fb586284ef3285232e90deb9513c1f5df63a9ece8ba65b1040be333","observation_id":"436a7c1b-a225-465c-8ada-000d3831bd31","resolution":{"observed_at":"2026-08-12T05:52:39.078828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.626029Z","title":"Complete 3d relationships extraction modality alignment network for 3d dense captioning","venue":null,"work_id":"7f4a3be8-d907-4e5d-ace1-d4db78a7da2f","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.082544Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:a38db361490412eb28b0db09857e8a70259762f6339fea4104b74ca3dec6eb62","observation_id":"e6bc15ef-8723-48f1-9373-49c9fabb3777","resolution":{"observed_at":"2026-08-12T05:52:39.629995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.615555Z","title":"Fast march- ing farthest point sampling","venue":null,"work_id":"fff99eca-a674-4841-b9d5-2317317f2a56","year":2003},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.085901Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:a9108671ae3d90908b2e05483331f62aec056378d626a6ff0025579d81d28067","observation_id":"fcb7ea36-d56e-4ff6-bfb8-8b15637dd329","resolution":{"observed_at":"2026-08-12T05:52:39.619272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.605316Z","title":null,"venue":null,"work_id":"f46db892-6f29-4b2c-84c3-8e86ccd1660c","year":2001},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.089388Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:e3f273abcf7ceeec6e6e3f315f9a2543c11fb296299e79777cd83907e914ceac","observation_id":"92c869c7-040a-4d31-a968-2efc09371682","resolution":{"observed_at":"2026-08-12T05:52:39.608796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.594854Z","title":"Bleu: a method for automatic evalu- ation of machine translation","venue":null,"work_id":"690190cc-4ec7-4162-aacf-76a0cd401e44","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.092970Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:08440acedb56c0a3c4fff9f5131a4632039822c3dc73fd98b2c088fbc73e74d7","observation_id":"f090482c-65cf-4746-b1fe-0121207eb516","resolution":{"observed_at":"2026-08-12T05:52:39.598612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.584461Z","title":"Clip-guided vision-language pre-training for question answering in 3d scenes","venue":null,"work_id":"10097e35-025a-498f-92e2-24189a8f7c6b","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.096376Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:4e0171660ba756af441281eae1371259f5382f05a76f52d7e86fc2a8497e7232","observation_id":"49d35b74-f1a9-4910-a2c3-23781e405292","resolution":{"observed_at":"2026-08-12T05:52:39.588087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.573704Z","title":"Pointnet++: Deep hierarchical feature learn- ing on point sets in a metric space.NeurIPS, 30, 2017","venue":null,"work_id":"af321c6b-783e-4c17-a201-c683f0b17530","year":2017},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.099843Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:77ea33d0ffbd09d3cf4813d1147de63dc9896b4894e5ee242492bb4c4888adc2","observation_id":"47f23876-4fb7-4129-b706-0d6f4fdd29f2","resolution":{"observed_at":"2026-08-12T05:52:39.577568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.563512Z","title":"Shapellm: Universal 3d object understanding for embodied interaction","venue":null,"work_id":"02bee81a-4f48-40c3-8f2a-b514c3c0ba86","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.103550Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:d8225ac0db83270a235335c416572ff9c2d89751a1d143d6fc877293c38c66ec","observation_id":"1ba314a6-8f16-491e-924c-a425c22ac426","resolution":{"observed_at":"2026-08-12T05:52:39.567216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.553545Z","title":"Semantic segmentation for real point cloud scenes via bilateral augmentation and adaptive fusion","venue":null,"work_id":"9f061cfa-f6de-47e4-ada1-823ee156fb1f","year":2021},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.106889Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:3ab0004f0e6ae25ccfc568da4d942fbc0a4be234ae558197f79195cfdd7d155f","observation_id":"e5e3eedb-aff2-44c0-a154-aeba247889b9","resolution":{"observed_at":"2026-08-12T05:52:39.557336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.544049Z","title":"Radford, J","venue":null,"work_id":"578952d1-3c2e-4094-a2c2-2da3d7609105","year":2021},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.110204Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:ad217a026169f61f2a08aa40b1eb6b91cc38a434340218560f0971f27989ba54","observation_id":"3fa46caf-32f6-4495-a813-dbeb9725378f","resolution":{"observed_at":"2026-08-12T05:52:39.547462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.534216Z","title":"Hiera: A hierarchical vision trans- former without the bells-and-whistles","venue":null,"work_id":"f6a013cc-9738-4e79-ad3c-e4aeefd571aa","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.114337Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:3390ac39315b32b26532e2f6635d314f263cdd9591a8ba5e10dc9e8031a2aa50","observation_id":"6f4d9b39-2c82-4ac6-a96f-be4c60a32e71","resolution":{"observed_at":"2026-08-12T05:52:39.537901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.523938Z","title":"Hilbert’s space-filling curve","venue":null,"work_id":"652db875-7172-4e2c-877e-5bfe360fa305","year":1994},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.117888Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:56621512cbc273bed7c1740342a396c1f5af5fc89d50f04bc725b1ce63a52f33","observation_id":"a26cabd5-09b1-4616-a948-806d337e4c3c","resolution":{"observed_at":"2026-08-12T05:52:39.527618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.512830Z","title":"When do we not need larger vision models? In ECCV, pages 444–462","venue":null,"work_id":"90b16733-a544-43e2-b593-dc642e3bd6a5","year":2025},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.121579Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:2425483e2b717e3602f8716498fb3f6f6a864640ad7281c2a2af2e0f7deb6e3c","observation_id":"327e157f-0927-44d3-9405-b87d983e7df8","resolution":{"observed_at":"2026-08-12T05:52:39.516774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.501969Z","title":"Fourier features let networks learn high frequency functions in low dimensional domains","venue":null,"work_id":"ff756d66-994e-470b-a47c-8c07d63a2d84","year":2020},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.125221Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:1840bf31648f7bd00ad5f838e1f8701cc32d3ed34101a75cf16aca9bb33d79b3","observation_id":"e5d80c2a-f6cf-44dc-b9fa-a49b1bc913fd","resolution":{"observed_at":"2026-08-12T05:52:39.505868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.490391Z","title":"Minigpt-3d: Efficiently aligning 3d point clouds with large language models using 2d priors","venue":null,"work_id":"2b02ec07-42fd-4605-8441-7ba2712ebb70","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.128648Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:bcb35be3e424d3319211639b23d82ab63792dd90496029ecc6da04961275fbc1","observation_id":"e20b9a0c-ad8f-4780-8fdf-33eed0a6333f","resolution":{"observed_at":"2026-08-12T05:52:39.494243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T05:52:39.131983Z","title":"Llama: Open and effi- cient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.131983Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:bd7850dab5a6bf163baf3c181b4551deadb33aceff66ecfe660e0d777445ebe9","observation_id":"f5b54a9f-b3dd-436c-a19c-14434509e455","resolution":{"observed_at":"2026-08-12T05:52:39.131983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.479831Z","title":"Cider: Consensus-based image descrip- tion evaluation","venue":null,"work_id":"f82eb673-89dd-4d33-9f5c-bcecf09dfd4b","year":2015},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.136633Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:66e4505041c5ebd7442be81f79df83f784f6a9be6fa6c03fac1e3f67d4cabbe2","observation_id":"d2ba5ada-ad0e-4158-b8e1-4df9317c44d2","resolution":{"observed_at":"2026-08-12T05:52:39.483560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10688","last_updated":"2022-04-22T13:07:37Z","snapshot_observed_at":"2026-08-12T14:06:44.280144Z","submitted_at":"2022-04-22T13:07:37Z","title":"Spatiality-guided Transformer for 3D Dense Captioning on Point Clouds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.10688","snapshot_observed_at":"2026-08-12T05:52:39.140170Z","title":"Spatiality-guided transformer for 3d dense captioning on point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.140170Z"},"links":{"cited_paper":"/paper/2204.10688","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:0c33a8489696c693ad034d0a55bbfb262f8ec171be71b3b4e9767369f2beacc4","observation_id":"1e2b1224-b8ea-42d2-8d51-134652b2feb0","resolution":{"observed_at":"2026-08-12T05:52:39.140170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.468990Z","title":"Octformer: Octree-based trans- formers for 3d point clouds","venue":null,"work_id":"704c5002-20c2-4c6f-9807-0635816283b5","year":null},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.143764Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:94a8cd637ce49468a946a9078095bc22fd171f6f5d23a84471c50f0673e52501","observation_id":"4bddd281-ac88-48e7-a68c-e4a0dacf1553","resolution":{"observed_at":"2026-08-12T05:52:39.472817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.457802Z","title":"Divergence-augmented policy opti- mization","venue":null,"work_id":"027c0ef4-de36-419d-9398-ab0d0272090f","year":2019},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.147302Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:00f88ebebdb5a039c68eed72a72b17c40e7be97cf2a99a1feff9178e0710069b","observation_id":"9792d6fa-e17f-48c6-bb96-7b25d6169f04","resolution":{"observed_at":"2026-08-12T05:52:39.461616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-08T07:19:32.263241Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-12T05:52:39.150873Z","title":"Chat-3d: Data-efficiently tun- ing large language model for universal dialogue of 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.150873Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:78c0ed63873dab9ecb5f73d85cc3185fe9cc34520f4889ef96a1d5f11f2b4b59","observation_id":"cec68e10-d158-4dfe-a7c9-b7f71c3ed394","resolution":{"observed_at":"2026-08-12T05:52:39.150873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.446776Z","title":"Point transformer v3: Simpler faster stronger","venue":null,"work_id":"d0756478-08ae-480d-b630-1561218cfe56","year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.154739Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:065523b3119c6f267a3857e14af3b7a788d3f5751c4af45952561599577a92d1","observation_id":"7e7229e0-0a62-4245-bd97-d707cb79d53d","resolution":{"observed_at":"2026-08-12T05:52:39.450796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16911","last_updated":"2024-09-06T22:45:43Z","snapshot_observed_at":"2026-08-12T01:26:03.061612Z","submitted_at":"2023-08-31T17:59:46Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16911","snapshot_observed_at":"2026-08-12T05:52:39.158355Z","title":"Pointllm: Empower- ing large language models to understand point clouds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.158355Z"},"links":{"cited_paper":"/paper/2308.16911","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:b7d9b82a0de39eb8e668cd6f01ff7a4651336fdf27b8e0136253511881676539","observation_id":"e9cb2987-b74a-4121-a0b9-134b25bc07f9","resolution":{"observed_at":"2026-08-12T05:52:39.158355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-13T00:51:59.402203Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T05:52:39.162003Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution im- ages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.162003Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:fce2c2353ccc4b95256651d1e675393abb8b2fc26db3624d1ddc44aec7d6b34c","observation_id":"5647cc14-a07e-43cd-b4f1-8ea8d72e7d65","resolution":{"observed_at":"2026-08-12T05:52:39.162003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.435125Z","title":"Focal attention for long-range interactions in vision transformers","venue":null,"work_id":"caf1e58f-5f6a-445a-9168-25e057dc109f","year":2021},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.165917Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:a0258354884fd781ef611e1b3116867df21f7335f0db1b20e74c1b7040e5fe3c","observation_id":"db89f7c2-540a-4a9a-96cc-3f3a53e6333a","resolution":{"observed_at":"2026-08-12T05:52:39.439052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05132","last_updated":"2025-03-20T23:06:14Z","snapshot_observed_at":"2026-08-12T23:47:39.392587Z","submitted_at":"2024-06-07T17:59:59Z","title":"3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05132","snapshot_observed_at":"2026-08-12T05:52:39.169470Z","title":"Fouhey, and Joyce Chai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.169470Z"},"links":{"cited_paper":"/paper/2406.05132","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:ef5dcb3686a964885c758010b496fd302f27573951f0f7bf6b29fd42033e88d0","observation_id":"bc72bc50-87ed-4809-9aa5-94633375f916","resolution":{"observed_at":"2026-08-12T05:52:39.169470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08359","last_updated":"2022-11-29T01:51:28Z","snapshot_observed_at":"2026-07-06T12:19:11.280873Z","submitted_at":"2021-12-15T18:59:59Z","title":"3D Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08359","snapshot_observed_at":"2026-08-12T05:52:39.173304Z","title":"3d question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.173304Z"},"links":{"cited_paper":"/paper/2112.08359","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:9b141a16e3c51e3caf070e79c4e07dd9492d07f12ef4a0d9815fef4f1b484763","observation_id":"ab51129a-acd7-4fe2-af20-68f6ab46e5b5","resolution":{"observed_at":"2026-08-12T05:52:39.173304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-12T05:52:39.176862Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.176862Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:35afacab68c5dbbc361d22af5684cb74ce83ae332ccd57dc54aaf9d152c5486b","observation_id":"387a662b-e323-4815-9365-ae8d9956435e","resolution":{"observed_at":"2026-08-12T05:52:39.176862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.423952Z","title":"Toward explainable 3d grounded visual question answering: A new benchmark and strong baseline","venue":null,"work_id":"54f9b455-4551-477a-9234-f5df180b9eb3","year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.180955Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:74f9e7fe6a33c02e0a3dee4ac1109abecd511b872902e70dd9000727d7a533d6","observation_id":"8e77bb5b-be83-460b-9021-a014b52180d1","resolution":{"observed_at":"2026-08-12T05:52:39.427809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03925","last_updated":"2022-10-08T05:33:00Z","snapshot_observed_at":"2026-08-04T08:41:50.061388Z","submitted_at":"2022-10-08T05:33:00Z","title":"Contextual Modeling for 3D Dense Captioning on Point Clouds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03925","snapshot_observed_at":"2026-08-12T05:52:39.184629Z","title":"Contextual modeling for 3d dense captioning on point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.184629Z"},"links":{"cited_paper":"/paper/2210.03925","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:7aed9064bbd4ab0426e017b931b22e0335ce9906419bd77d1a3c6c306939e6ac","observation_id":"0c7a2a0e-d478-49f0-a810-a42a05df7657","resolution":{"observed_at":"2026-08-12T05:52:39.184629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-12T22:36:38.589325Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-12T05:52:39.188568Z","title":"Llava-3d: A simple yet effec- tive pathway to empowering lmms with 3d-awareness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.188568Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:86fe7424672740ed838fd4eab494f2806ce42d7ce45ac0ef1e1461339d5f8e72","observation_id":"a3dcffa2-bb4c-480d-a93b-fb0497b7a48e","resolution":{"observed_at":"2026-08-12T05:52:39.188568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:39.412398Z","title":"de- scribe","venue":null,"work_id":"7801c4a5-b01a-452d-a35a-34a90457c16d","year":2023},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.192613Z"},"links":{"citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:db87f5cedfdc6dca2d93b184bd99bebad44277e04d03c1bdae2fe4063e646875","observation_id":"189f9e8f-1439-4dae-b2f5-e7293131e7b6","resolution":{"observed_at":"2026-08-12T05:52:39.416264Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T08:06:19.747349Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":48},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2411.19774."}