{"as_of":"2026-08-08T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73e4d5a8377292b70bbc6686040651c60e291ba99eee2205b83121eb66446c09","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:47:08.442715Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.21489/citation-record","integrity":"/paper/2507.21489/integrity","json":"/paper/2507.21489/citation-record.json","paper":"/paper/2507.21489"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T12:47:02.365253Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:02.365253Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:546446f4bf8a023bb0f8d1ef320ab59652d2c7bd29db12ddd9987e897c67b941","observation_id":"e4aac53a-8eba-4245-841e-e1b4050517d1","resolution":{"observed_at":"2026-08-06T12:47:02.365253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.856695Z","title":"Learning representations and generative models for 3d point clouds","venue":null,"work_id":"95a9e51d-0701-4144-a50e-0f0e8d3e9d2c","year":2018},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:02.433911Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:e84389a3a90448eb78c9dd8b93108705f4bfd7e145e0a37560097ee8f3c8f755","observation_id":"b8ea0d4c-9b69-4cf2-862a-5c3cb8f73ddb","resolution":{"observed_at":"2026-08-06T12:47:14.859434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:02.604846Z","title":"Flamingo: a visual language model for few-shot learning.NeurIPS, 35: 23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:02.604846Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:b2d44c5b28af266211a30b0b82c479d8d601116a2f7e3731469e6a3fcad3c137","observation_id":"999751b7-9af4-4ca8-a8cc-b92716dae7db","resolution":{"observed_at":"2026-08-06T12:47:02.604846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T12:47:02.780795Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:02.780795Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:4ac775fdf7c06584968b6f236eb8dae8e08e1df5075aa24eea2be4d3fbc8679a","observation_id":"a43544f7-af1f-4cbc-8234-efa0de1b77c9","resolution":{"observed_at":"2026-08-06T12:47:02.780795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T12:47:02.884100Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:02.884100Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:b6cef42e50927316508ea6481060b18e38e2a7c17fbba7582e611db7163d2fda","observation_id":"4fcf1764-3975-4614-a34d-31129cb75b39","resolution":{"observed_at":"2026-08-06T12:47:02.884100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.843583Z","title":"Shape matching and object recognition using shape contexts.IEEE TPAMI, 24(4):509–522, 2002","venue":null,"work_id":"e7d6a5d1-2643-449a-a40b-2cfaaa06ae9a","year":2002},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.016796Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:48e0e8d7a23164a6ed8f70ec746b9be26fbe0deba643e552ff6e29f483b3bb1a","observation_id":"ee5ee636-8bd2-4873-aacc-a58928464e15","resolution":{"observed_at":"2026-08-06T12:47:14.846394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.835351Z","title":"On visual similarity based 3d model retrieval","venue":null,"work_id":"68933b98-538f-435e-a0d5-9b613fed055d","year":2003},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.094828Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:12de57cc9ab865ec6f85645fae2aab72982dfc16ed9083aa2816ad6d13226118","observation_id":"58286fd9-015a-4f4e-984a-91c3fb966a67","resolution":{"observed_at":"2026-08-06T12:47:14.838131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T12:47:03.150233Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic.arXiv preprint arXiv:2306.15195, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.150233Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:6416b49e2ec762634bc184f27770232e05ada0ff77d16aae3c5da43859aea664","observation_id":"5c7843a9-6416-421f-b833-a417b1c5031d","resolution":{"observed_at":"2026-08-06T12:47:03.150233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.827762Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"f0808052-a8f0-4c3b-ae8a-c6b07c0d944d","year":2024},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.233035Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:bdc6bd395f015a9b63816e63de6f52adbf952e4454a8946a8810a4b15b9d169f","observation_id":"5eb4c32d-f262-4321-8e27-7fbdae07ad64","resolution":{"observed_at":"2026-08-06T12:47:14.830563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.819783Z","title":"Pra-net: Point relation-aware network for 3d point cloud analysis.IEEE TIP, 30:4436–4448, 2021","venue":null,"work_id":"4660cac8-db10-407c-97a7-3fde9b344128","year":2021},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.286593Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:ef9dd8aa83f31b99464d41077f05d2a1dabbd04a2c061bbddb1d14fbaf7441de","observation_id":"fe416e7f-c5ba-4648-9501-e4e7818801cb","resolution":{"observed_at":"2026-08-06T12:47:14.822525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.812172Z","title":"Abo: Dataset and benchmarks for real-world 3d object un- derstanding","venue":null,"work_id":"239d1784-9041-417d-95fa-0835fd9554b0","year":2022},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.332545Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:4e9199b36323c4ac9765a7aca992ca1bbfaf0e8ab672a387a5af29b7a80675fc","observation_id":"cae22099-756b-4a79-ae48-34d4b763b966","resolution":{"observed_at":"2026-08-06T12:47:14.814815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:03.405200Z","title":"Siamese cnn-bilstm architecture for 3d shape representation learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.405200Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:1059434004ab3d4e5103bad83a8a2a9c3f84d632767a1c54be7fcd517db46747","observation_id":"8c13730c-450c-4356-a4b1-c9c1ad63dfa5","resolution":{"observed_at":"2026-08-06T12:47:03.405200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.799267Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":"09f65309-b1d4-4cf4-acd3-ad93262376b6","year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.490927Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:df8b87d94895d7ab5dfcbcdb278595ba6c42ca7bc6b25e188fcf3829dd67f2e7","observation_id":"f48d7503-23da-495c-9c5c-1ca5fc3aaaf0","resolution":{"observed_at":"2026-08-06T12:47:14.802001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:03.553089Z","title":"Equivariant multi-view networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.553089Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:c00049c109edbcc52aa38f5d57a293d3282712a3cc3a9621a0f12dad3d517adb","observation_id":"fc43a5cb-36cb-4c0f-adff-13eabd631bfa","resolution":{"observed_at":"2026-08-06T12:47:03.553089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:03.614094Z","title":"Gvcnn: Group-view convolutional neural networks for 3d shape recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.614094Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:61a4d0f01b92557a58f2fdb081ff983ba9fc08330bef110de6e8eae3fef9ea77","observation_id":"2495eeda-fb6a-4edf-9f30-bbecd515182c","resolution":{"observed_at":"2026-08-06T12:47:03.614094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.780915Z","title":"Meshnet: Mesh neural network for 3d shape rep- resentation","venue":null,"work_id":"ea018b21-69d5-4561-984d-5db4119ca66b","year":2019},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.664107Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:886740d610983dcd867055f65ff7791cf7cf14a7af1d01b4ba368136e5b2fcee","observation_id":"1a816f62-9280-4509-8bfc-ac887bb3fe15","resolution":{"observed_at":"2026-08-06T12:47:14.783681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.773325Z","title":"Shrec’22 track: Open-set 3d object retrieval.Computers & Graphics, 107:231–240, 2022","venue":null,"work_id":"3cc65f07-46f7-420e-b4d2-419b1e775858","year":2022},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.721045Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:df6b5144c9e2007f568dba138649023d32d4089cdb95d372166f2795581d5aba","observation_id":"f4b2d03c-7c35-4a48-9b51-6edd2ecf2adc","resolution":{"observed_at":"2026-08-06T12:47:14.775924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.765634Z","title":"Hypergraph-based multi-modal represen- tation for open-set 3d object retrieval.IEEE TPAMI, 2023","venue":null,"work_id":"db6ceb0e-ea83-41f7-8c1c-9ca5533f1252","year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.779910Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:2869e5b10e90e31002c5e966c29fb8d97a3947a0252b28a45c3d72dc41657773","observation_id":"4d4f070d-1df2-4fa2-867c-d24670e22292","resolution":{"observed_at":"2026-08-06T12:47:14.768338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.757974Z","title":"3d object retrieval based on similarity calculation in 3d computer aided design systems","venue":null,"work_id":"e7d75488-9b44-4610-a6c0-bf0bf12b2609","year":2017},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.851713Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:dfd14303d4b9dc5d999bef7db4dd150bc9b1552df7d67c546c05c6c2c3b84be2","observation_id":"bcff649d-f534-48c4-a44d-4bbf168d559c","resolution":{"observed_at":"2026-08-06T12:47:14.760873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.749703Z","title":"Clip-adapter: Better vision-language models with feature adapters.IJCV, 132(2):581–595, 2024","venue":null,"work_id":"3ed1cf0d-79f9-48a8-b84b-82bc72f2617a","year":2024},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.918093Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:8e55dfbe060e990fa3f51ef6abd98bd0757c497e023d054783ce3b457d1c0bb1","observation_id":"10d8b2a7-003e-42e0-a19a-46879c8ada4a","resolution":{"observed_at":"2026-08-06T12:47:14.752571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.741640Z","title":"Deep learning for 3d point clouds: A survey.IEEE TPAMI, 43(12):4338–4364, 2020","venue":null,"work_id":"9a4635ea-9cbb-4a96-abd5-c4cca32e09d2","year":2020},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:03.981913Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:55e93f0cd8d657ebb7bd750bc5aeafc6bdff7b3584cb5a8cb5554e0bdba87a22","observation_id":"76847e5b-f7f0-4c99-b861-0e6491b9ae51","resolution":{"observed_at":"2026-08-06T12:47:14.744371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:04.041414Z","title":"3d2seqviews: Aggregating sequential views for 3d global feature learning by cnn with hierarchical attention ag- gregation.IEEE TIP, 28(8):3986–3999, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.041414Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:080568f67fa9f5a534d5878bb606b396e8776cbff6e5665b471a10cb102a6668","observation_id":"a962f3c3-cf0f-4410-8616-8d0bc53dfd3d","resolution":{"observed_at":"2026-08-06T12:47:04.041414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.728400Z","title":"Triplet-center loss for multi-view 3d object retrieval","venue":null,"work_id":"b4c2f9ae-3d7d-449a-baaa-2b307f0dad92","year":1945},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.169624Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:992a36272e0c94e84813e7f43be61cb1e844af321d58e0d964848b61a67c231c","observation_id":"88effd1b-bd57-4880-80f8-ad08d88e8368","resolution":{"observed_at":"2026-08-06T12:47:14.731351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:04.239337Z","title":"View n-gram network for 3d object retrieval","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.239337Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:53787629d3642b25de459487a4a08a810c5249d342221be691b14f3139566725","observation_id":"3dfcf5d2-0e93-49e3-bbaa-ab326a267836","resolution":{"observed_at":"2026-08-06T12:47:04.239337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.715160Z","title":"Latformer: Locality-aware point- view fusion transformer for 3d shape recognition.PR, 151: 110413, 2024","venue":null,"work_id":"bef870f6-15e9-41fc-9ceb-3ebec14008ff","year":2024},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.300096Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:535d297fbd01b6da13bbbafb66bfee75d3868aa66d7c2e961f1a08a10e41d5e5","observation_id":"815893c3-e0a6-4b80-abef-14fc8b3f754c","resolution":{"observed_at":"2026-08-06T12:47:14.717957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.707067Z","title":"Clip goes 3d: Leveraging prompt tuning for language grounded 3d recognition","venue":null,"work_id":"d435bcb3-6acb-4fdc-b2f4-1e97d2057d90","year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.368902Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:350d3b868b6feff75d02e3ecec2ccc972f2ac9ee85888e3a10f4aa2ec6d876ef","observation_id":"37b4c765-2053-4fb8-807c-91540a2c986a","resolution":{"observed_at":"2026-08-06T12:47:14.709871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.698581Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"b6a4b0e0-dbb5-4a84-a288-3f378053b06f","year":2022},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.423232Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:aeaca5d031fb1d232eb7e4f2a395c22a623906157442f991dcd4a8db4ce0e7a0","observation_id":"7386090c-3e0a-4375-9fd0-c1e07f7a3495","resolution":{"observed_at":"2026-08-06T12:47:14.701250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.690837Z","title":"Scal- able deep multimodal learning for cross-modal retrieval","venue":null,"work_id":"93614383-3ef7-4560-9714-0e7b70726600","year":2019},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.470427Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:eff242def2617d17cda2159a37c3409f24b8896294d21f53defef4184e9d8bf0","observation_id":"117d2cdc-be8b-4cf3-a377-2cbd543781f4","resolution":{"observed_at":"2026-08-06T12:47:14.693541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.682351Z","title":"Clip2point: Transfer clip to point cloud classifica- tion with image-depth pre-training","venue":null,"work_id":"288e0ad0-4904-4cf7-a311-d39764010d51","year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.527676Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:b4cf8432b325c3fe0b97fcd03b0319a519e9aaca61fdc5588a3671f955515bf6","observation_id":"4daccc3d-7e4b-4ebc-9ace-3d51d8f055bd","resolution":{"observed_at":"2026-08-06T12:47:14.685113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.595967Z","title":"Developing an engineering shape benchmark for cad models.Computer-Aided Design, 38(9):939–953, 2006","venue":null,"work_id":"1dd062d6-0798-4daf-ba8e-446bbdf318ea","year":2006},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.572553Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:8178b9e21c62424718322dde2d964cd9235bba98a6e4804d5850c4f4b406c504","observation_id":"01dbc503-4c9e-4fd6-b786-753e0d282054","resolution":{"observed_at":"2026-08-06T12:47:14.676422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.385447Z","title":"Cross-modal center loss for 3d cross-modal retrieval","venue":null,"work_id":"d48d7106-5549-47b3-aeb0-baf3817c5253","year":2021},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.655578Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:fdece3eacbd584c28ea111e47c60f71a377870ef59d06a60fdf4b49a1fd8a57e","observation_id":"3cb8bc34-6b35-4991-9fec-1da2e7051ed5","resolution":{"observed_at":"2026-08-06T12:47:14.529357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:04.728566Z","title":"Rotationnet: Joint object categorization and pose estimation using multiviews from unsupervised viewpoints","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.728566Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:8cdf4a9a7a628707644a87b5b99493c19ef7f9353aad000210d7dd32537af2c8","observation_id":"1a92f109-709f-4ad2-a78c-e501fd6c3e7b","resolution":{"observed_at":"2026-08-06T12:47:04.728566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:14.115061Z","title":"Rotation invariant spherical harmonic repre- sentation of 3 d shape descriptors","venue":null,"work_id":"99499224-2b4a-4143-81e9-47e4bbc32b57","year":2003},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.817478Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:daa46c3bec7dd597206293c05674bcce5da2add3289afcc85a7ea4589cf8ccd2","observation_id":"44a49962-a314-47a7-b401-c029592c416c","resolution":{"observed_at":"2026-08-06T12:47:14.259037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:13.852062Z","title":"Re- search challenges for digital archives of 3d cultural her- itage models.Journal on Computing and Cultural Heritage (JOCCH), 2(3):1–17, 2010","venue":null,"work_id":"665a21b5-6f0e-4db1-b257-9d732b4a65de","year":2010},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.879461Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:55cf40be51f4d2e0127e42e494c1d82312996fc8bc826ec99716f9bc4dd6a287","observation_id":"9243c747-567d-40b2-b973-5ffb1feeeb1c","resolution":{"observed_at":"2026-08-06T12:47:13.992856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:04.974880Z","title":"Angular triplet- center loss for multi-view 3d shape retrieval","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:04.974880Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:d2be787d092fad6a07c219d9103db500ed59cf81dfacb09064b6f0b56d456be4","observation_id":"4ab4e967-f98d-4b2d-a1d5-b3c9b8692492","resolution":{"observed_at":"2026-08-06T12:47:04.974880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:13.576142Z","title":"Meshmae: Masked autoencoders for 3d mesh data analysis","venue":null,"work_id":"5bac0a7c-e9c5-4188-abc4-2eb65539d2d1","year":2022},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:05.049444Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:7ede8033e0282ff40fcd709866306d0ead1898706e0d02fa5933bea07c3c5b02","observation_id":"bc8403e9-a325-4f6f-8ae6-c364dcd4624e","resolution":{"observed_at":"2026-08-06T12:47:13.736307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:13.288489Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"730b2cc6-8219-45a3-a0ed-f73c5e03b12d","year":2024},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:05.138939Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:f3e573054a4687c422203095bd7def5e91566932c9f16a29c14cc295d72d141e","observation_id":"5e48812c-ecfb-49ac-b19d-496b2f16b128","resolution":{"observed_at":"2026-08-06T12:47:13.482566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:13.026336Z","title":"Visual instruction tuning.NeurIPS, 36, 2024","venue":null,"work_id":"cc89c631-22a3-4d39-b918-d91977331608","year":2024},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:05.175939Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:e6ea1f1fb24b14f7f638a7c3ed7cc1c90928cb8afc4c2ff3ce7ef37995834329","observation_id":"264362b9-fa81-4531-b6c5-7806627be3d0","resolution":{"observed_at":"2026-08-06T12:47:13.133129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:12.774714Z","title":"Openshape: Scaling up 3d shape representation towards open-world understanding.NeurIPS, 36, 2023","venue":null,"work_id":"26c3cdad-0ee9-402d-9666-5c3b29a2c2b5","year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:05.277656Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:0091fcaa5dc77efe0495bb02179420bbb1edeeb1347d1bb313cbafc3dad2b9e6","observation_id":"8a090f86-d450-4e86-b979-d7a3d59422da","resolution":{"observed_at":"2026-08-06T12:47:12.863259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:05.339949Z","title":"Point2sequence: Learning the shape representa- tion of 3d point clouds with an attention-based sequence to sequence network","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:05.339949Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:09aa7d7264a9177362c603847a9d3388c6818f8cbeed18b3dc74c72b4fc032c0","observation_id":"c71387ad-3397-4a1b-96cc-a86cebe9f79f","resolution":{"observed_at":"2026-08-06T12:47:05.339949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:05.426858Z","title":"Relation-shape convolutional neural network for point cloud analysis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:05.426858Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:a47a1861ea2544db3745f78aa276e4de984cd25ce0bb22366de54e1770a8b65f","observation_id":"387e2f23-ae6f-4852-91fb-4a6812ffd73a","resolution":{"observed_at":"2026-08-06T12:47:05.426858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09958","last_updated":"2023-09-18T17:30:46Z","snapshot_observed_at":"2026-07-06T16:20:04.775700Z","submitted_at":"2023-09-18T17:30:46Z","title":"An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09958","snapshot_observed_at":"2026-08-06T12:47:05.523805Z","title":"An empirical study of scal- ing instruct-tuned large multimodal models.arXiv preprint arXiv:2309.09958, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:05.523805Z"},"links":{"cited_paper":"/paper/2309.09958","citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:e9ddfa7345489076671b703c191b93fdcdb6449914d59b78e6c777c879727411","observation_id":"4e2d60e5-80c3-4e40-92a4-26d27bc026b4","resolution":{"observed_at":"2026-08-06T12:47:05.523805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:12.543021Z","title":"3d learning objects for augmented/virtual reality educational ecosystems","venue":null,"work_id":"57ab6b87-a868-4e6d-99aa-9ce0c3f70af0","year":2017},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:05.621772Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:06349719fa5cff553887c9b878cdc76cf3d1d2c88933b6cccfb512010487f91a","observation_id":"0315681a-189f-43f7-a31b-854b87843fc2","resolution":{"observed_at":"2026-08-06T12:47:12.619734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:12.356152Z","title":"V oxnet: A 3d con- volutional neural network for real-time object recognition","venue":null,"work_id":"e42cb61d-cd11-4a89-ba9e-60ea16f4c8d9","year":2015},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:05.685811Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:7bd2d177286e3bfaf400bf1344096dac820a5eb2347e548dc428a0b6d3c2f424","observation_id":"bb366d37-50fe-4ac3-8559-cc8366f9941c","resolution":{"observed_at":"2026-08-06T12:47:12.433140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:12.188574Z","title":"Mmjn: Multi-modal joint networks for 3d shape recognition","venue":null,"work_id":"6626bdf0-32a6-48a5-995c-907837fec53b","year":2019},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:05.754575Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:60b608b31f6e270b98890161ba7b9e67b0d0164dd4294a0c62b4129920e0caea","observation_id":"16e478c5-a186-41a6-9a3c-e69da20444fb","resolution":{"observed_at":"2026-08-06T12:47:12.273646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T12:47:05.854039Z","title":"Repre- sentation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:05.854039Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:8654a35a4e19c3c051c9aff359aa2d45c5455b77398d26898babd84a1e45056f","observation_id":"30ad683e-6621-4b01-bd3f-c78dfdf80f9f","resolution":{"observed_at":"2026-08-06T12:47:05.854039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T12:47:05.946843Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world.arXiv preprint arXiv:2306.14824, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:05.946843Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:958da0b55e10e3bd2fbbda2e5bd557e4f62fc1d29d49d27b47241428d19e6787","observation_id":"4fcbc6c2-0bbd-44ee-bec3-5f48dbc128ec","resolution":{"observed_at":"2026-08-06T12:47:05.946843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:06.016588Z","title":"Pointnet: Deep learning on point sets for 3d classification and segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:06.016588Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:0b01428cb3faa2977a3392473e550aa6cd7deffdd8fd2d6f14250fff241e7627","observation_id":"c7c831b5-0ae5-464f-9eaa-86b921d388a5","resolution":{"observed_at":"2026-08-06T12:47:06.016588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:06.111380Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space.NeurIPS, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:06.111380Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:f60ab5e2727395d7d505713fe97ba0a5fb5140c65ac860dbaf936c3db5557f86","observation_id":"8029e1ed-a18e-4386-ac80-e70f2aabe21a","resolution":{"observed_at":"2026-08-06T12:47:06.111380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:11.996178Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"b1d22b54-62a8-4cb8-8d1d-d66115137da7","year":2021},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:06.175609Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:cac966a5e6f9b9c9e26e03f9cf4526dc5910f2ebad3eb2e9c343f104bfd8ecbc","observation_id":"d8739b54-3665-4a47-b467-36176d8b2325","resolution":{"observed_at":"2026-08-06T12:47:12.064361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:11.816721Z","title":"Clip for all things zero-shot sketch-based image retrieval, fine- grained or not","venue":null,"work_id":"c17e4367-95ac-4ff8-8059-66aab4234663","year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:06.305599Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:daf03253ce8411ca2261c3c097c6f90e0c984adf66192ae9d6ec2e906c23fdd5","observation_id":"dc8afc3f-b0ee-46a0-8976-33c0606fed60","resolution":{"observed_at":"2026-08-06T12:47:11.906256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:06.406724Z","title":"Deep- voxels: Learning persistent 3d feature embeddings","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:06.406724Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:5e6888d128c237dbcaf814d187a665302e623e6aafb84a69f313957b6dce4904","observation_id":"bda63105-a27b-41c7-a280-a5f7059b94f3","resolution":{"observed_at":"2026-08-06T12:47:06.406724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18402","last_updated":"2024-09-11T12:21:04Z","snapshot_observed_at":"2026-08-02T01:39:54.358298Z","submitted_at":"2023-11-30T09:51:53Z","title":"MV-CLIP: Multi-View CLIP for Zero-shot 3D Shape Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18402","snapshot_observed_at":"2026-08-06T12:47:06.495224Z","title":"Mv-clip: Multi-view clip for zero-shot 3d shape recog- nition.arXiv preprint arXiv:2311.18402, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:06.495224Z"},"links":{"cited_paper":"/paper/2311.18402","citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:0097188122f9342bb08ec17ddb08bf8e38d43e3f7965221055070f4c5e902d09","observation_id":"093cc193-e569-423b-bba7-a872a33dc293","resolution":{"observed_at":"2026-08-06T12:47:06.495224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:11.655894Z","title":"Multi-view convolutional neural networks for 3d shape recognition","venue":null,"work_id":"77a26424-e683-4949-9b0e-3d848dfd6945","year":2015},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:06.598342Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:e8699e48c5377e29372cf1fa414f6dcac9d8fd618dcb7926bc45f2d5f5356e23","observation_id":"09ecf3ad-d5ec-4928-bba1-82ec6115d2f7","resolution":{"observed_at":"2026-08-06T12:47:11.726653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:11.507832Z","title":"A survey of content based 3d shape retrieval methods.Proceedings Shape Modeling Applications, 2004., pages 145–156, 2004","venue":null,"work_id":"b394cb3a-9506-4e3a-a276-127157fae4f6","year":2004},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:06.714822Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:0297e5fed5252ce149551d6698140e981275bb92de71ff73be4571f96a7d239c","observation_id":"e7c38b4e-a674-400a-9ecb-4b353a3fbb1a","resolution":{"observed_at":"2026-08-06T12:47:11.555829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:06.823291Z","title":"O-cnn: Octree-based convolutional neural networks for 3d shape analysis.ACM TOG, 36(4):1–11,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:06.823291Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:fed3199ff612917254a23d92c7e099ab24c744c57dc3801e273d1f8931d4e2ae","observation_id":"ff79b94f-e89e-434f-93ce-072747635032","resolution":{"observed_at":"2026-08-06T12:47:06.823291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01907","last_updated":"2023-08-03T17:59:47Z","snapshot_observed_at":"2026-07-06T16:02:15.266899Z","submitted_at":"2023-08-03T17:59:47Z","title":"The All-Seeing Project: Towards Panoptic Visual Recognition and Understanding of the Open World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01907","snapshot_observed_at":"2026-08-06T12:47:06.899224Z","title":"The all-seeing project: Towards panop- tic visual recognition and understanding of the open world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:06.899224Z"},"links":{"cited_paper":"/paper/2308.01907","citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:574941b14a7459d3e0ad6b8230c71f408292101199a2f4c605ade835d0fbdbe0","observation_id":"a403d6d1-6d31-47a6-a48e-6014de054a3b","resolution":{"observed_at":"2026-08-06T12:47:06.899224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:11.291580Z","title":"Visionllm: Large language model is also an open- ended decoder for vision-centric tasks.NeurIPS, 36, 2024","venue":null,"work_id":"c86e3ebb-c8d2-49c0-9815-c4f4983cdbfb","year":2024},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:06.982283Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:9c8f9b9cb040806c05e788e48633504a5a1caf04ea46cb9b1e1b5b468b67d0b6","observation_id":"e314d4b6-7a1d-4cc5-a012-1192015977bc","resolution":{"observed_at":"2026-08-06T12:47:11.375033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:07.080674Z","title":"Dynamic graph cnn for learning on point clouds.ACM TOG, 38(5): 1–12, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:07.080674Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:68de3bf96bbd87a22fc56e7b4445fde0793dac2abc0f4fb959abc67896296a3d","observation_id":"1380f257-583f-429f-9251-464e7b45e0d7","resolution":{"observed_at":"2026-08-06T12:47:07.080674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:11.127561Z","title":"Teda: Boosting vision-lanuage models for zero-shot 3d object retrieval via testing-time distribution alignment","venue":null,"work_id":"21df6aa9-b13d-436f-9688-92e70da190c8","year":2025},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:07.146620Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:f6d05fff40811e5b6cbcd1c5cfa8cb6ec657e4638fac966c360d92fd097c56d7","observation_id":"c94a750d-7e34-4468-93b5-fbe661deca4c","resolution":{"observed_at":"2026-08-06T12:47:11.173636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:07.221969Z","title":"View-gcn: View-based graph convolutional network for 3d shape analysis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:07.221969Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:7fd4d90780cfa26f8566306cfcaa97f57d160f445f47d21aad64e2876b2d13b8","observation_id":"d7f9ed69-099a-468d-876a-b5a4a4f2abc6","resolution":{"observed_at":"2026-08-06T12:47:07.221969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:10.945025Z","title":"Multi- modal semantic autoencoder for cross-modal retrieval.Neu- rocomputing, 331:165–175, 2019","venue":null,"work_id":"b3a66e28-4ea8-4e9d-974b-e687fc856019","year":2019},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:07.328959Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:1b533369275ebc2398ae149d36d52db85c86c914b157751387419b5a10af1cbe","observation_id":"85db8e0f-ccce-4c71-b8e5-487058e71b2e","resolution":{"observed_at":"2026-08-06T12:47:11.027826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:10.789717Z","title":"3d shapenets: A deep representation for volumetric shapes","venue":null,"work_id":"a400e6bf-6ff1-44e2-b267-a53f0cabed00","year":1912},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:07.421895Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:48d7c5d7186a98b21127cf6b896e8b493191f822fceef2ea382b2f5b6039923a","observation_id":"275c8697-f4eb-44d6-a860-a909dc8abef6","resolution":{"observed_at":"2026-08-06T12:47:10.885400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:10.588809Z","title":"Ulip: Learning a unified representation of language, images, and point clouds for 3d understanding","venue":null,"work_id":"3aaa6064-7624-43dc-85bb-52a75c222ea2","year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:07.509907Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:ed8d33a730498c5ab3c7970bee87fcc8997efd19b969e4c0cfd30d442ee43ffe","observation_id":"fca0dbe6-d017-462c-a767-61c1cd11760a","resolution":{"observed_at":"2026-08-06T12:47:10.685990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:10.264467Z","title":"Ulip-2: Towards scal- able multimodal pre-training for 3d understanding","venue":null,"work_id":"e198f273-f852-40e2-92f4-7e6b9a7fa7d5","year":2024},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:07.617149Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:828919a177641af079606eb2eac3e9a66cfb6c97b298f53a98cfdc75abfb021e","observation_id":"ae7e5cdc-a3e6-4b3b-bd74-2ecaf4757c92","resolution":{"observed_at":"2026-08-06T12:47:10.425943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03930","last_updated":"2021-11-15T04:58:28Z","snapshot_observed_at":"2026-07-31T03:05:21.352948Z","submitted_at":"2021-11-06T18:09:22Z","title":"Tip-Adapter: Training-free CLIP-Adapter for Better Vision-Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03930","snapshot_observed_at":"2026-08-06T12:47:07.732480Z","title":"Tip-adapter: Training-free clip-adapter for better vision- language modeling.arXiv preprint arXiv:2111.03930, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:07.732480Z"},"links":{"cited_paper":"/paper/2111.03930","citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:02c39cb92600f9a2b0d69f3b8ed1dd3e230e9d9ee763b25d7c9d5491b63cea65","observation_id":"89ddbaee-7950-45b1-af27-331e577b8107","resolution":{"observed_at":"2026-08-06T12:47:07.732480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:09.973671Z","title":"Pointclip: Point cloud understanding by clip","venue":null,"work_id":"e5fefdd7-f0d1-488a-8134-f4508f03fde6","year":2022},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:07.848450Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:ab59b8e275d49bca2eb5287f41b1bdfe40587c91a99e46c3411ac3cc39788360","observation_id":"e8df5b5d-f60d-4d5e-8225-a4105bb3babe","resolution":{"observed_at":"2026-08-06T12:47:10.117082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:07.936148Z","title":"Pointweb: Enhancing local neighborhood features for point cloud processing","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:07.936148Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:bb6924adeff465b346766d3d005392009aa63a1b2af18e9317553278e9ee4ced","observation_id":"05b9e1ca-ef95-4da3-b4f4-2028089a2c1e","resolution":{"observed_at":"2026-08-06T12:47:07.936148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:09.617716Z","title":"Multi-channel weight-sharing autoencoder based on cascade multi-head attention for multimodal emo- tion recognition.IEEE TMM, 2022","venue":null,"work_id":"ebd10cda-769e-45a6-b6a8-cfe561e66f69","year":2022},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:08.051113Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:2819cdc3b40c383dd27281fd0233729b77d08d84ae1c486420582ed1754175ff","observation_id":"f10a92bd-5966-4dc6-8d42-9d3c9d6401a6","resolution":{"observed_at":"2026-08-06T12:47:09.781355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:09.296845Z","title":"Learn- ing placeholders for open-set recognition","venue":null,"work_id":"c0b2d282-fa98-4987-b7db-af8535e16b96","year":2021},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:08.150545Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:661d4b65f75ef2fe0c99fa885adf11d14cd65e3ea0bf1d5fb6b517f9c9b92291","observation_id":"e481f9f8-bba0-40ff-a853-2e15e11a0493","resolution":{"observed_at":"2026-08-06T12:47:09.475429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:09.070153Z","title":"Uni3d: Exploring unified 3d representation at scale","venue":null,"work_id":"153b236f-e6ec-4f3a-9e0a-f1a02b931555","year":2024},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:08.268396Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:7fe014a3885faef14e726953f5038ca59e38c89299d72f678714531be22e45b8","observation_id":"28f81f8b-4d9b-48af-8aed-88c93bcbcdff","resolution":{"observed_at":"2026-08-06T12:47:09.202898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:08.830965Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"e4ce4548-380f-4710-bf5e-233f367c0840","year":2022},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:08.364823Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:b68a9709386fe591cfb24a4d2fcc5cd2cba44c0ef946d6d9275ce84e1c09481c","observation_id":"45e08547-3a65-4d11-af5e-f1a239455cb7","resolution":{"observed_at":"2026-08-06T12:47:08.939053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:47:08.634272Z","title":"a synthetic 3D model view of [cls] with different an- gles","venue":null,"work_id":"63715e80-463c-43fa-891e-ed2bd3a0ccd0","year":2023},"citing_paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T12:47:08.442715Z"},"links":{"citing_paper":"/paper/2507.21489"},"observation_digest":"sha256:6b325b802b8bc1485c7faeacaac9da0561a07e4978a76d46abace59d2086de20","observation_id":"99ffab05-b885-4d1f-8e5d-d0f8446993a1","resolution":{"observed_at":"2026-08-06T12:47:08.708015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21489","last_updated":"2025-07-29T04:11:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T12:47:01.043881Z","submitted_at":"2025-07-29T04:11:05Z","title":"Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2507.21489."}