{"as_of":"2026-08-05T17:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2238d2b3e2f194e4d386afb178401b40ee2c86195277004d3b1ed25c8b601de6","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T06:12:48.722467Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.02908/citation-record","integrity":"/paper/2607.02908/integrity","json":"/paper/2607.02908/citation-record.json","paper":"/paper/2607.02908"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: European Conference on Computer Vision (2020) 4, 5, 6, 10","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:b65a725809656ca943478ae8072c1a8bf223528322496afb90bb0021e34c6a03","observation_id":"829da139-5baf-49bd-b2b1-69ea8e432f23","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF International Conference on Computer Vision (2019) 4","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:4c9fb00ebe8f4f45daaa34de688f22a68100eb889dc720026a1ab2151d2fb775","observation_id":"d50d6c80-85c6-4aba-b2d6-b517086105a8","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: European Conference on Computer Vision (2024) 1, 2, 5, 6, 10","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:d25f5dc17d4472de47bae9e3e6223ce58a0c716daf69ff24266c9b1244eb9fd0","observation_id":"c4ffb155-c23b-4907-b9fa-fbb9f1e6f21b","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (2022) 5","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:9fb7df0e002e0847df2054fe2d86a1c258afa7c7194b7963f3ce38a32dcf8285","observation_id":"2014ffd6-ff72-4ed6-a07f-3ee4a53d2a24","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2510.10903 (2025) 1, 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:3727c3e731ab2cab0a857992f0aa72c29a112aed60875fc9ca2a78cc0ad864c7","observation_id":"42c802a7-0006-4cab-bdd2-26a847a5ea1b","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Proceedings of the Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and/or Summarization@ACL 2005 (2005) 6","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:dd5e54c7806cf8ce2e5240750b02ceb37f0b1461c2470d1901065318ea5b80bb","observation_id":"7996503c-3d77-4a51-af29-0adff0710d9b","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2410.24164 (2024) 1, 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:ffa57fc21b2b1af46da2fb08cca492daea793391e3675203227e6abf9fd01c8e","observation_id":"0e27fb37-0e02-4e41-a145-63af416aafd2","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (2023) 5","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:917d37d471819e3d73e583af43b885add708ee4021aad4fcdb49168096015fe0","observation_id":"b0e46359-f5b8-407e-af2a-bd3e03632bca","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:c9656ec6062be48007fa1d84f60f988c22642f966c4eade3a1d7f1b926aff4cd","observation_id":"fdf0691e-41d1-46d7-acf2-d62d52d71eba","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.09403","last_updated":"2020-08-21T10:16:01Z","snapshot_observed_at":"2026-07-06T09:49:03.699991Z","submitted_at":"2020-08-21T10:16:01Z","title":"Exploiting Scene-specific Features for Object Goal Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.09403","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2008.09403 (2020) 21","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2008.09403","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:b7f6b6faf249790916d91d195dd02ff4d1caca589a18ee32723a5589f32ef302","observation_id":"61e9e3cf-2d70-40e4-83fa-3fa33572f338","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: International Conference on 3D Vision (2017) 9","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:c8ba177408e1995d6ffa3b2893deaf730e4a89cb7e0eeaaa9a1fab32b313061c","observation_id":"e6f208cb-ed03-4605-8657-208cc7545df4","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Conference on Robot Learning (2023) 6","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:53f3110fa1783954a98f5c9ce27c1b6423ea2a9c6e41713ac1360e00eb4e400f","observation_id":"31eb07b1-21ce-4df1-aa4a-3ec52890eeee","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: European Conference on Computer Vision (2020) 4, 5, 6, 10, 13","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:b218a7a755663b6afd7d033e576ed85e71e0436dc32633a94de18849e3357e08","observation_id":"fad97fa5-aea7-493f-bb42-e2b76ea9725c","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE Conference on Computer Vision and Pattern Recognition (2021) 1, 2, 4, 5, 6, 16 26 K.-Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:511a8bc1701732bda9a49b77ade078b4cf92b3b070899681a08f87d40def0bcc","observation_id":"e6bb58fa-fec9-4ee6-b6e3-87f7e9b77f93","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: European Confer- ence on Computer Vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:4d1a2ccba200a863bcbebc40a4153c34797882973d6dad4e8ebf7292a95c17d0","observation_id":"be56e23e-0cbd-4673-a3e7-009cf26ef299","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (2024) 3, 5, 12, 13, 20, 23","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:6e6405adff14672db95b5bcb17cb3465de081886e3d8ac398d6cc92368387d0a","observation_id":"66d60d5f-f247-49de-9ef8-01c55ae13a84","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (2023) 1, 2, 4, 5, 6, 12, 13, 20","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:d2a5f5e9df1e609e95122029f24471d768dbde30a25557832602bc8e2c53f0d0","observation_id":"f99e3f39-9949-4dd4-b578-715bef9cf573","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence 46(2024) 4, 6, 12, 13","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:b905ba312f7c1190840f00510f67d156f71e00f19d72a8250aa80c354e994a94","observation_id":"51fda539-d9d0-4a4a-931a-83530cdc14a4","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE Conference on Computer Vision and Pattern Recognition (2017) 9, 10","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:5c3c0e34c9bc6d9afb4be8fa959105a716fb9bdc0dac6d9cbaf839d996103321","observation_id":"b6f23ffa-4aff-478c-b4e3-39027550aa3b","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Neural Information Processing Systems Datasets and Benchmarks Track (2021) 5, 9","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:21f06ff43a4de6cbb1e648f333aae17fc6266478140bb21d38672b4dbdb37a77","observation_id":"e64a9cdf-4faa-433d-85be-cd206e4be924","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:1592f2e136cbec6142171b12f152919cb83ba0006acbda54091405323916e571","observation_id":"89e1f93b-9097-4459-bdd9-b244652788cc","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2405.19092 (2024) 6, 20","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:f8545071705743d11e55456aca1d50e69a941bbcebc114d3ae62b368f189e890","observation_id":"f4e26d98-e229-4de5-8b26-f342ab24b51f","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2407.21783 (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:15be05d523244f80dbd100a131b5fbb174d0cb6d30e9167029dec18291834c31","observation_id":"9a764f80-878a-4389-ad58-e120f8206fff","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2509.14981 (2025) 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:0ff2f355142e1a1e2083c62ad5aed0966811be4a2b611b1655e12e71685ae54a","observation_id":"d649baf1-37c3-433a-8f72-8241392fb09a","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:87ee08a083ffd1ebb5a6be5d17f3867af0b5569cf1196ac2629d513eaed00ed0","observation_id":"7a71bddb-50d6-407d-837a-365cbd884f13","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE International Conference on Robotics and Automation (2024) 6","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:9607dea731390f0024f877148c5bb3847bcdbfe3b4ffdba7afc22eb887ad030e","observation_id":"95aac788-2628-4dc9-b7b0-69e340e579a7","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:7e6046921cb9d80dd7d6d060fd6586537e37ddcdb07868ead1213511130b858a","observation_id":"7ab4ca9f-5742-44e4-b1fb-9d2096214d1a","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Neural Information Processing Systems (2023) 5","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:fb00706b67ff796cdb0dbae2e37d61f5b31eb54f7b1cb61c23c9aa993ebcccd8","observation_id":"7d0edb07-7c65-4d8c-b3a8-b0d4bb772179","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Neural Information Processing Systems (2024) 5 Holo-Captioning 27","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:c044b872a4632bb11c9ca30de27cf8140f27b1b788517952418e9be1fb0bde5a","observation_id":"63e88fe8-c75c-495e-86f3-0371da425b27","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: International Conference on Machine Learning (2024) 5, 12, 13, 23","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:8292845d71edeee3764337fd63912b84d87d6e1d3cc4d5286ca903eae3ac5f1e","observation_id":"a74de81b-07b9-4eeb-b1b2-e349229c8462","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07781","last_updated":"2025-07-10T14:01:24Z","snapshot_observed_at":"2026-07-06T21:55:07.643679Z","submitted_at":"2025-07-10T14:01:24Z","title":"SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07781","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2507.07781 (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2507.07781","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:1a966699e88987bcdcdd1b29d9c6f3412482c02e407fd2d0ae49e7f067839081","observation_id":"e147e5dc-eb09-4b09-b902-16ed734977d4","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23478","last_updated":"2025-07-31T11:59:06Z","snapshot_observed_at":"2026-08-03T20:10:09.370344Z","submitted_at":"2025-07-31T11:59:06Z","title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23478","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2507.23478 (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2507.23478","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:06a1a2d4bb6ad45af6df57865a581739440055bea5637fedc9bf1bcaee1c2be1","observation_id":"b6594511-bf0c-4e67-86e7-8989054b6a2b","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE Conference on Computer Vision and Pattern Recognition (2026) 5","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:fc09e55928168374bab30e181b9364cc3c8bd50e1fb52665b12f54113ac93d80","observation_id":"741cf6ad-22f5-47d8-b90f-1cf6f79482d3","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Neural Information Processing Systems (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:e7af164f08b28882774dc37768a5ad60cec64415d7eb84c7c7af7b89f20cd15d","observation_id":"f774a01f-8616-471f-bcb4-7444972bd9af","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: European Conference on Computer Vision (2024) 5, 9","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:6a7c14dde2de1983edb14dac557959ea9c921af31d0d37dbe1186ea2d83b04a2","observation_id":"04122914-1e17-445a-9542-cd28c1f364a0","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF International Conference on Computer Vision (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:c14ee0d9d8fb06449720766857e557ee0540b753173c70ff463824354bfb06a6","observation_id":"f1172411-616b-45ac-aad7-9289564cb49f","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:e2edc78427b612557c655fcaa59827b61645e82d37c2f3625a4d8d0e4fe10b34","observation_id":"2350d330-780e-469b-ac8c-ac9f28f1db3b","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2503.19786 (2025) 13","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:2e72b68edf010867ad0ee93f6bc8e4a3afa351e4d57ec9742198fd3950205a2b","observation_id":"ce9edb96-a021-4646-90b9-89b8d0ce388e","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Findings of the Association for Computational Linguistics (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:3cb049381328d54de7847d53bda173bdc98fcd40eb9ce55cf8acd5e0c54a1712","observation_id":"75a5ef87-b3db-433b-8778-094abeb1a62c","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:5d30fe1849041c1b10afb79fd777edc754f93baa8d2dd2c4bc23457985165af2","observation_id":"867294db-1147-4dcd-9cee-8ae12ec083f2","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2509.16721 (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:7c4bbab9f0efe836a76628f4f5092097808f90ef2eb239ce07ac81c721a4add4","observation_id":"f869c0df-c551-4320-aa08-c4be945004eb","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:b2a8ec2dd1a5e36a76c606ad75205d8ebe136a776f371e47120dd57a23477036","observation_id":"cf47ff04-a51d-4a7d-a12e-14eac959b408","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07753","last_updated":"2023-05-25T03:50:11Z","snapshot_observed_at":"2026-08-05T02:35:14.331933Z","submitted_at":"2022-09-16T07:17:23Z","title":"Code as Policies: Language Model Programs for Embodied Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07753","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2209.07753 (2022) 23","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2209.07753","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:3d1f6e4a66c446f9e0d72ff6b1a37bb4e033d7a8519e53c51c2cf23d57271c57","observation_id":"1c6f3731-5b7b-41d9-984f-eba33afdfdb4","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Neural Information Processing Systems (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:178179585b628cfc813ab29070afa78df49c6aa6445bcca24b246cf925bce85a","observation_id":"0ccd50ba-e862-4787-b316-29b1cca859c0","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Neural Information Processing Systems Datasets and Benchmarks Track (2024) 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:26ad5f3eb47944e8026dbf6c137d75fb0b6fdaf6ad9531a4d2d5b9659cdc2b74","observation_id":"9d3fb531-e082-454e-8ef8-45440efe40ce","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Neural Information Processing Systems (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:4cd5eff2fb491460572fe22aa31271a0a61c2e06304eab730b92a7f316b6667b","observation_id":"e36daff3-104a-4e56-b33c-4625d85c35dc","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: European Conference on Computer Vision (2024) 4 28 K.-Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:695a60b60268afcde4b4c1823d05c05b6aceb7f660fdf4ebfe2bfc0ea9ffbf15","observation_id":"71ca3713-c23d-407e-b38e-af546263400a","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Oh, A., Naumann, T., Globerson, A., Saenko, K., Hardt, M., Levine, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:a751b2f10b28169110db7995dd7587407c6a9e63cd376d64e4653d75f922517c","observation_id":"28d2ff66-47c0-442a-878c-f6a7397ec894","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Neural Information Processing Systems (2024) 5, 9","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:a6649674f438c67c5ac04d634d9225ca404f7193030eb71793240ba0b18900a2","observation_id":"45f84eab-563c-4fdb-a63d-5b7757d93e4f","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: International Conference on Learning Representations (2023) 5","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:8a8f1fdfea971e9e21da081d8ddd6976604df64921ce942086cea0a93473bf7b","observation_id":"714bb697-39cc-4409-805d-9cd04f2dda0d","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Neural Information Processing Systems (2022) 3, 14","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:ab931ec1b88e764e3671cd4425cc946064387cf4cb70a6545947e16acd643c92","observation_id":"c14def2a-3f46-420f-b322-c726a11c7dd3","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Neural Information Processing Systems (2025) 1, 2, 3, 5, 6, 10, 13, 18, 19, 20, 23","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:0ac3cdec7ada3b287a152f235b6b6509861569ad84396fde5c74a0b55d2f0918","observation_id":"5dcff752-7ed8-488c-bfc3-b496218f8380","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:fa7ab3714a39469d1085d61635d20310b6fffc6e510341fe1aec61c01d62092c","observation_id":"a5c3cbcc-1314-45a2-8bdc-1e6df7580e1a","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Annual Meeting of the Association for Compu- tational Linguistics (2002) 3, 6, 22","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:cdd1f1fe9508a0ee08880c40de90a2ff2ebcecaba63b4da9b2055e15ae926468","observation_id":"2e2ca8eb-c4c5-444f-852c-2bb1c2cf64fc","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-04T09:46:24.709821Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2501.01428 (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:27afcd2aac1dffe210e092d2c94a2d5bc18a935c812425352fda5771aebb44ae","observation_id":"94eb3c21-e4a1-4a59-9fde-60aeeb1b28de","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2511.21631 (2025) 23","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:187d81709f5795c33738e4962b6ea1388480bd08ed72e167c60f4655d51ebde8","observation_id":"f67b2348-bec8-43e6-bf35-5e03b5c80509","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Conference on Robot Learning (2023) 6","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:4fad2bae4390e418d56ca34c3bf74c3aae12433bedfdca2610046669685c5e7b","observation_id":"db048688-e5ab-4fad-b3d4-9f8eb300ff5b","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE International Conference on Robotics and Automation (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:ec44456203b5d65f16f6507ae301b20a2814b14e401d2a5ddd2e9b32c7e3d73e","observation_id":"a913066b-f9fe-456a-a9cd-2cc06c854199","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15442","last_updated":"2025-06-18T13:14:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T13:14:46Z","title":"Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15442","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2506.15442 (2025) 14, 20","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2506.15442","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:9afd884cc211c487039d172a3b1a457e511adb006e89c5ea778d7f02ce079fb2","observation_id":"98946e16-b693-44aa-bddc-5331367eaed1","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"Journal of Mech- anisms and Robotics15(2), 020801 (2022) 21","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:72775b6cac5ed71b72f35c475336f6f1904c7826520e64402749b2ffd5e6005c","observation_id":"d72a4de0-a73c-43b9-b2cc-83081bc2919e","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE Conference on Computer Vision and Pattern Recognition (2015) 3, 6, 22","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:a61229e54e7fc1abaa9f824f3f5d64dd7f02f6538513052c4b8e8c7b2c7b6dff","observation_id":"e34bc011-7df3-4b30-9ffe-e313892487c8","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Interna- tional Conference on Computer Vision (2019) 9","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:ead62606baf46cfda820c38bd3ab9cce16fd2710121eeee93d1231a28af775ce","observation_id":"be7f900d-0aa3-4c87-a851-0e2093a0c33e","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (2020) 4 Holo-Captioning 29","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:b5582ad75677d5dbba9a13acbfb43b2aef85a50297d28cdcc5ad39c03c0640b7","observation_id":"e2002e46-0685-467d-b36f-45c098115478","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: AAAI (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:826cbed982d8c3b956e51393331783f3ebdec77c1696d167646096271e2eb85f","observation_id":"22f52b19-7a67-4be8-b823-4acc4895b8db","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (2024) 5, 9","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:7f72390596cdea443b1bb5f27e47ceeef9e9ddaeaa95d6d6fc64a9f2c766762f","observation_id":"2882e1d0-29c5-4af5-8def-5b09e871fc6b","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-02T00:22:05.597306Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2308.08769 (2023) 5","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:c8f73c11f619f7b64545897927a2ce60f9ae51a73fc4c404cbfdbd9450ec44d9","observation_id":"01bb8a30-c8cc-4e9f-b4d4-88022c153ef6","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Neural Information Processing Systems (2024) 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:a86e18f1147938071d1635aa6f2f5cbbc3669d0cadee48b6cdee73e16335f15b","observation_id":"7a25c228-b89a-4da8-99eb-89c20d569d5f","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF International Conference on Computer Vi- sion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:5a9d8a61b4f66574dfa5a78da65a4d52023ea6b263331a4f306ebc84dbf3097f","observation_id":"55ed052f-8217-47ed-89d4-d756dd23aa1a","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Robotics: Science and Systems (2024) 1, 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:4f4d8f60035cbe0e6b5121cc265f85bc38ac3e9a1944e111f7c738db86f49849","observation_id":"6c0cca11-d749-4a24-8a78-6189041ca2e7","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Con- ference on Computer Vision and Pattern Recognition (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:c73a322c3cbe27fa782f7a80378e5e7e969f5fb99dd6cd5020e2ed78be9a8a87","observation_id":"a5c70583-ca5d-4a04-8c9d-d1b1723e5b19","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"Neural Comput","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:56385cccd0c46a2ed1e5f122e30bfb3381f0003243a2aafaa8ef65e446ad1bc3","observation_id":"2c22d3dd-04f1-4d07-9c76-df11de86f607","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: European Conference on Computer Vi- sion (2024) 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:28256b443731aac41615bc6fc814e0855b74c02f376f3f2f5c6cf3b2c2c84a0b","observation_id":"db54430c-b913-4b84-b245-15c42a97f94d","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: International Conference on Machine Learning (2026) 5","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:3af90d47161d32a97d377dc3dfa8e2653da092fb4b29c8d66e28a6e519de0d83","observation_id":"3b97bee3-d79b-49fc-9152-b2a8582f36cc","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pat- tern Recognition (2025) 13, 18","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:5405da68f8a12d72fdcdb4a20ff6eae65ca52ebd8f15b4232b2717eba83ddebc","observation_id":"3fb45b70-10a8-4b63-aeae-bf447c39aee4","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11806","last_updated":"2025-07-30T22:34:42Z","snapshot_observed_at":"2026-07-06T20:52:59.928598Z","submitted_at":"2025-03-14T18:45:19Z","title":"Human-in-the-Loop Local Corrections of 3D Scene Layouts via Infilling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11806","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2503.11806 (2025) 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2503.11806","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:6d8d9a9bc15e10121c3ca7155e3177e82377f470919d36c777cf00304deacef2","observation_id":"639e746c-19dc-48ea-9133-928191c379c1","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: European Conference on Computer Vision (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:aace08ce147dffdaeed8690ea0aafd3ae069ee5e3f524192ca58e45776d87d89","observation_id":"407ca237-5053-4f30-a0ec-b3765727a29d","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2505.09388 (2025) 13","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:fcf5578bad51061e7b1e1a5b22b7c20cee3bcdb2c1c8ab4c4fad2b92cb3469c6","observation_id":"652cdef4-2f4f-49ce-917a-17bcfba86749","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2412.15115 (2024) 18","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:96b756cf0009ead72859a668231c308a915c1fcabba62ad3014b58e275c9bc74","observation_id":"5a91e304-266f-40d5-a551-5f4159801379","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recog- nition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:0a06b6da4aeaa6c2c7ceeedac4e5b9705c119d02c25b674498e3a57e3d0ad423","observation_id":"5f9e2024-7174-4afe-93ed-bbcdb52b1bcb","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: International Con- ference on Learning Representations (2025) 6 30 K.-Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:bf57c681a3bb8af781719b53ad93d5c1f649724ac5781694799e54cdaf3fb802","observation_id":"c273b637-595f-4b68-8196-8f4267cb4212","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF International Conference on Computer Vision (2025) 4, 6, 10","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:6868c08d01483b6be9115cd5de9b0c4edd0037b67cf42191e5c3dff7ae650a6d","observation_id":"95fd4445-4c85-4960-b37c-1f7ed9e664fd","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (2022) 4","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:94bac3f1a2d325a8c0ed8c361e9e3d5217a8b258d6e392d22f51b3ac1739e047","observation_id":"bdb69f46-18d2-425b-9a97-11a27c4bbdb0","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: International Joint Conference on Artificial Intelligence (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:12e2734ab8ac2f4faaf7150556738fcb9f5700f1930bab5cfdd8538f7d9fa104","observation_id":"5f128144-2635-4ef0-ac3d-84bc7e5375a6","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"arXiv preprint arXiv:2506.05176 (2025) 8, 13","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:5a95e85804d70221523ae2f5f7dd47c1106e15fb4832df3227cdc66948fce024","observation_id":"42395726-968e-4059-84ae-bdf76ada751a","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Neural Information Processing Systems (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:8c2e13a38a386cb65cf03f3a810baff0eb564cbf305281b90a17cef822f3bfb6","observation_id":"740b03b4-7fbc-47df-befa-3b36602b016f","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:04c39434d96b7a0da6604f3785e75f18ce52783ff3cd9f0ea08ff4441d202d57","observation_id":"c400efe8-3cc9-4e76-bef7-42ef2ad4045a","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: European Conference on Computer Vision (2020) 9","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:780851f4c1471e37c615faea6327c3ae51c2043491467851d0f2f7568fb1d120","observation_id":"d7e1b9f1-f476-4bb0-ba89-3b174180dc60","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF Conference on Computer Vision and Pattern Recognition (2025) 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:c88674efaeeacc7294ceced388cdbb939424439ea1fd9c27ff964df7c4eda9f5","observation_id":"424e6aab-0cf0-4ffa-9e3d-65adde122029","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: Neural Information Processing Systems (2025) 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:aee0fe6cc3dc4d2eb936a7fc9139f8de8214bb12ab7ec285666697e9058d84b8","observation_id":"9cd1492b-93b6-407d-ae36-dc53e6301976","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: IEEE/CVF International Con- ference on Computer Vision (2023) 5","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:9724e56b40f0b0ca17b86efbbda250b9fda9d5260338601b58f47d167fe4d5dd","observation_id":"d24a58c8-db4a-4f08-8c87-ad22903669f9","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:12:48.722467Z","title":"In: European Conference on Computer Vision (2024) 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-12T06:12:48.722467Z"},"links":{"citing_paper":"/paper/2607.02908"},"observation_digest":"sha256:24b676891ff7a037c16f20f918d09bd47a0dca828630b3415fa878e2b9edc023","observation_id":"4432c857-dd52-4622-ae4b-92d490ef6797","resolution":{"observed_at":"2026-07-12T06:12:48.722467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02908","last_updated":"2026-07-03T03:14:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-12T06:12:48.090334Z","submitted_at":"2026-07-03T03:14:17Z","title":"Holo-Captioning: Toward the Text Equivalent of 3D Scenes"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":91,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 0 inbound Pith citation observations for arXiv:2607.02908."}