{"as_of":"2026-08-21T13:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac83c0532d81b52bed54336e45cadbaa1bf5b4da8d3378ae10b414be36b5b321","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T23:59:10.664837Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.16100/citation-record","integrity":"/paper/2603.16100/integrity","json":"/paper/2603.16100/citation-record.json","paper":"/paper/2603.16100"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.18457","last_updated":"2026-04-23T08:02:03Z","snapshot_observed_at":"2026-08-15T03:31:43.799649Z","submitted_at":"2025-10-21T09:30:45Z","title":"VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.18457","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Vision foundation models can be good tokenizers for latent diffusion models.arXiv preprint arXiv:2510.18457, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2510.18457","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:12a7556a2439a553fab1f8870e0998cfcbcf7fb729ac07dec017fbe18753137e","observation_id":"8b191f6c-b551-4616-9223-e989d8797b6c","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Must3r: Multi-view network for stereo 3d reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:14b5ed000ed5e69ff6965e1d2a3d485f685ad9cce34a87cbc1d1ccf038971f30","observation_id":"029fcd65-4a84-4d40-9d22-c98fc5063885","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:b9b488bd6c5fa7f7b95b88aa9f11dd4e2dbbe3e926afaa6590a40db28061b3a4","observation_id":"0d0af5a6-35f5-4d0e-8262-7177a648fe2a","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Aligning visual foundation encoders to tokenizers for diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:27c82f68089e0ce4b43ab2345a2df0f2675a392ddc700d98536a2447cec883a2","observation_id":"80a75a05-95b1-43cd-a147-5cd79a5712b8","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:bba92ddd24622c821381420c26c7beca45de2c1123bacabd98f978b32d6e4fd3","observation_id":"814399c9-b3ab-49e7-975e-696a3475917e","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Mvsplat360: Feed-forward 360 scene synthesis from sparse views.Adv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:fb61033d72a20e783060cf364761ec7fbd4f1b9e566b25aa0affa7c6c864206c","observation_id":"0ae1eaf4-2b11-4fa0-8cbd-1fbaaea832b4","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13384","last_updated":"2023-11-23T11:40:16Z","snapshot_observed_at":"2026-08-19T13:44:43.671372Z","submitted_at":"2023-11-22T13:27:34Z","title":"LucidDreamer: Domain-free Generation of 3D Gaussian Splatting Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13384","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Lu- ciddreamer: Domain-free generation of 3d gaussian splatting scenes.arXiv preprint arXiv:2311.13384, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2311.13384","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:4e5a7718969ee582f64d009231971268f6a2be754030f3bdd35f24b5fd48460f","observation_id":"e291774c-2c90-4813-beb4-9e100a05a10b","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Fantasyworld: Geometry- consistent world modeling via unified video and 3d prediction.arXiv preprint arXiv:2509.21657, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:764c87e02d90b6b03e315b7686c131c92e64867e078328039150b08245f1e76f","observation_id":"e51f91fa-c2a0-4b31-b0ac-30a7af277477","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Understanding world or predicting future? a comprehensive survey of world models.ACM Computing Surveys, 58(3):1–38, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:d759b253c864594d1ff5d0c57fce08ffbd0598715a5f2019f57b8395d5bc42b9","observation_id":"b0556425-314d-4603-b771-be678fa1efa4","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Worldscore: A unified evaluation benchmark for world generation.arXiv preprint arXiv:2504.00983, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:031ae23faf53a2ff58f1f8f42b2655dd08dd9cae225b0227ae187562ea2b25d0","observation_id":"560faeba-434c-46bf-833b-269fe1ee157b","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Scaling rectified flow transform- ers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:05b4a7932fe9c51432ad73ca55a15ef334d7eec3fd5183b4b537cd8be102a970","observation_id":"3d53ddcd-6942-4b62-a14e-643cadecb456","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Scenescape: Text-driven consistent scene generation.Adv","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:2698275b9a61631f6de8fe0aef49d4142571c518ceec283639a0ec6b2a6f1c76","observation_id":"f5145c32-1329-4b85-b503-ac26695ac591","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10314","last_updated":"2024-05-16T17:59:05Z","snapshot_observed_at":"2026-08-15T07:34:03.035482Z","submitted_at":"2024-05-16T17:59:05Z","title":"CAT3D: Create Anything in 3D with Multi-View Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10314","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Cat3d: Create anything in 3d with multi-view diffusion models.arXiv preprint arXiv:2405.10314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2405.10314","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:b1c555a9987afae4ac80ce4e1387c7ee25286d1dfff2b581a8ebb56086af2ae1","observation_id":"6f55b328-21ac-4ec4-8d5f-45dee050b867","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Vist3a: Text-to-3d by stitching a multi-view reconstruction network to a video generator.arXiv preprint arXiv:2510.13454, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:446675c2d3ab238fc4b6d626e8f99dea285eadef2991b24d34d7f4bd2dc201ef","observation_id":"ddbfb5d9-f222-44db-b50a-674e00cd5ce9","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Splatflow: Multi-view rectified flow model for 3d gaussian splatting synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:36f301eaaf32a757cd3101a7de0b2d2e1e8a378c854b448d6a6860c988375a91","observation_id":"7355950e-28eb-408b-948c-e31c809e4972","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15855","last_updated":"2025-03-20T05:26:09Z","snapshot_observed_at":"2026-08-19T03:25:03.504116Z","submitted_at":"2025-03-20T05:26:09Z","title":"VideoRFSplat: Direct Scene-Level Text-to-3D Gaussian Splatting Generation with Flexible Pose and Multi-View Joint Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15855","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Videorfsplat: Direct scene-level text-to-3d gaussian splatting generation with flexible pose and multi-view joint modeling.arXiv preprint arXiv:2503.15855, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2503.15855","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:68495142505cda94770337658de07fafe84da8d0d4d863b75aaf313eeabaacaa","observation_id":"71f69703-2e26-437f-a660-2156b4d42b74","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-20T20:37:36.775968Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:0a48b6164387558630a15511fcc9fd93338c6211ecfe6bd9f67d982c35da6a9d","observation_id":"705d5836-de75-4a73-a082-ccc5d2e8c2e7","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10001","last_updated":"2025-04-16T07:43:01Z","snapshot_observed_at":"2026-08-16T12:41:26.794782Z","submitted_at":"2025-04-14T09:04:01Z","title":"GaussVideoDreamer: 3D Scene Generation with Video Diffusion and Inconsistency-Aware Gaussian Splatting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10001","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Gaussvideo- dreamer: 3d scene generation with video diffusion and inconsistency-aware gaussian splatting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2504.10001","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:6c248f4d55f8807bfb2ee0fe180a26283b81e85b4d4f614ceec24cc176b1b71f","observation_id":"8eaf07e2-437c-44bc-b307-3852179d821a","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:c90e13391072439350ffaff59b479271934cd0cd25882292e14d5652a34f6a05","observation_id":"e9912137-1bb0-4f12-8215-2b49e58d0f3e","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Gen3r: 3d scene generation meets feed-forward reconstruction.arXiv preprint arXiv:2601.04090, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:09802b583c1cb0b0059a6ffd22dc4e3635562c407486cca50c743483457dd6a7","observation_id":"f30304b8-828d-4b70-ba03-61e8eeda9523","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:0f79612661e0ac121c0a39bb2ddc3a1c2ab0efd286171e45d19ef735b46b3a46","observation_id":"1bc43f44-ca18-4f7c-b32a-cf0f18da9a17","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models.IEEE Trans","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:09507125fc1fcf525c040580f2e9305dc1fce85d034e415ec7c0eaf348943b0c","observation_id":"352d9f85-c5e1-4f6d-90b5-c7628a5d1c16","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Anysplat: Feed-forward 3d gaussian splatting from unconstrained views.ACM Transactions on Graphics (TOG), 44(6):1–16, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:6d87d4c893dc79d9e78f6ad247bbe9dd09bdbbda62a15af9aa354f4bf0fa6bf2","observation_id":"dc999ada-a0ec-4ef1-bcb9-3e2afb9a144f","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Lvsm: A large view synthesis model with minimal 3d inductive bias","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:06cbcebfb4adc52a8cfe9448bcaf088564d612792100c1b9dc67f43569a88e5c","observation_id":"991ec32d-c686-473a-96c2-50b3f7625870","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Elucidating the design space of diffusion-based generative models.Advances in neural information processing systems, 35: 26565–26577, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:350ca7ea64d7eb2d19e9ac05e6c61c42e40b7c616e553abb85629c7b755d2590","observation_id":"de1c2ced-e61d-4a5f-ac97-08f8cdcd4d29","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:2830371c40aee72fc318de47f6c4dd9070bbc7b1a8c35729082d3c4a3297e339","observation_id":"02970360-4ced-4ff0-907e-1d63bd49cefb","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Auto-encoding variational bayes.arXiv preprint arXiv:1312.6114, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:87a9efe7562f6f5233edd28c1052381e3670443cdff8f20c6b993f5f0b438851","observation_id":"543fde11-da9e-41d5-a7b4-689f283f7f4d","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"3d and 4d world modeling: A survey.arXiv preprint arXiv:2509.07996, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:45b2c996caed7cefc73c6850c5a432539634ac0825a4e2b0292da005309bdd2f","observation_id":"403da686-007f-4955-816d-033c1afbb8b7","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Grounding image matching in 3d with mast3r","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:578f6a3a82bdefebc20f6be95c6a2f5db5e059507a248c05db2e3e87a1e0f45b","observation_id":"c2374c19-65bd-49ce-800b-ae2e3b25088a","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.13720","last_updated":"2026-01-07T05:36:57Z","snapshot_observed_at":"2026-08-21T07:43:41.799880Z","submitted_at":"2025-11-17T18:59:57Z","title":"Back to Basics: Let Denoising Generative Models Denoise","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.13720","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Back to basics: Let denoising generative models denoise.arXiv preprint arXiv:2511.13720, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2511.13720","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:e926a06e789a3d9184c0d7e1f5dfa2acf4157e4a32b1e41cc2e3d7e2c6dafed9","observation_id":"604af6f0-5621-4631-88be-95e162737a4e","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Director3d: Real-world camera trajectory and 3d scene generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:5bee00853281ddecc3ef58d0ad80d9429a8a340bac6bcf330ca4048b602efab9","observation_id":"cef447f8-6916-4e8c-8ae6-83403d54ab8e","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Flashworld: High-quality 3d scene generation within seconds.arXiv preprint arXiv:2510.13678, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:b7ded2bf9911f4c89c16ee13e1fb3c60abb774ad2a326738d01e6083371e2d39","observation_id":"95bc99e7-20d3-4b02-a727-df2a501705b1","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Magic3d: High-resolution text-to-3d content creation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:e6bccd4fcc6afe182e76dd4075d35da0c7cbe1e85c305867df6b687dc52d0218","observation_id":"30bfbe6f-5c10-42fc-b12c-2ac83b0861ba","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-08-15T23:16:19.228206Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Depth anything 3: Recovering the visual space from any views.arXiv preprint arXiv:2511.10647, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:c06cd4485b1e4cf27f6d67fbee0a30641b5ce1356b0278921abe12427a3cf4d6","observation_id":"c37928b5-bcb3-4d24-b4d7-0a1adbe93de1","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:4004f787ffd2a9dac925d9eb43f84b5b1d8150430ee279c4c5725ca1c89a7484","observation_id":"3ba1740b-ac28-41d2-8153-63f9eeafa229","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16767","last_updated":"2025-06-25T07:19:44Z","snapshot_observed_at":"2026-08-18T09:25:14.498467Z","submitted_at":"2024-08-29T17:59:40Z","title":"ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16767","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Reconx: Reconstruct any scene from sparse views with video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2408.16767","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:679a2426b3d88b511e857536763b2cf30035c9f3dbdc82146108261043d95f3e","observation_id":"4c8cfda2-339a-4d03-be46-940c150ad8d7","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Zero-1-to-3: Zero-shot one image to 3d object","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:4050f1a965e53161746f50886decc4cf6f67ad1c33335f1332284704d37c6008","observation_id":"c8715932-6374-4356-9d36-cc8d31bd2254","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03453","last_updated":"2024-04-15T10:28:44Z","snapshot_observed_at":"2026-08-12T22:52:54.817720Z","submitted_at":"2023-09-07T02:28:04Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03453","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Syncdreamer: Generating multiview-consistent images from a single-view image.arXiv preprint arXiv:2309.03453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2309.03453","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:8d0119db7eb67664c32ab5285a8a41d627160d5463ee2472e75bcba3231efb61","observation_id":"a4bef872-e3bd-4c8f-9f17-63a523de2573","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:89d08596942f1a10a607c3d6312bb30ccf1066509a70c83f5f9d1676ae7ca02f","observation_id":"c4504ef3-9fa6-46d7-995f-2a263de570b3","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:571d3c7633de3671c6015ed7c03768e8338edc38c8a493b9958ff2b7735477fd","observation_id":"42d91b02-966b-4f8f-b7a2-7089ef97822f","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:c010cd989eddf9d623a702b9b4bdaa13a979f2162b3ad32b305324887cf0b768","observation_id":"241d1dd4-1b49-4482-b34e-d530dafd3bac","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:b36e8f86b6082ec7e0e981bee14057461d6fd06221705fc285137c91058e4622","observation_id":"7405044f-6abc-43c6-ae42-c48bb46d52e7","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:299c9d7e869ebe82091f19a8bfa8fe7b58fc7cd3c00fef22edbf04c14bd8baab","observation_id":"5bcb0028-f47c-47ae-8136-f85b288aec51","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Dreamfusion: Text-to-3d using 2d diffusion.arXiv preprint arXiv:2209.14988, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:729395210ba859ffb81ca4b93558952d68faf9ece33961f212cb0fbcd7ef7f87","observation_id":"cf64ae49-015d-46b8-b965-fb4962161767","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Gen3c: 3d-informed world- consistent video generation with precise camera control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:0790211a590be214048e32e213c70f06063c87e13a62ae9102386327e250a231","observation_id":"291c1345-acf7-4652-9137-3668ebd08304","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:5ad828c925169853e1fd81c9a87575e5e7a37938ffde6f71235f5a1c1c0daa47","observation_id":"00ee1852-2741-4697-9b90-4b033fdc00b4","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17994","last_updated":"2024-04-24T01:08:12Z","snapshot_observed_at":"2026-08-16T14:48:20.855879Z","submitted_at":"2023-10-27T09:06:43Z","title":"ZeroNVS: Zero-Shot 360-Degree View Synthesis from a Single Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17994","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Zeronvs: Zero-shot 360-degree view synthesis from a single real image.arXiv preprint arXiv:2310.17994, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2310.17994","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:fe36d7cd0524b9d422b6ee754c2773df713c82c737febeea3402b7f1326fc67c","observation_id":"cb7738e9-891f-4075-a6e7-4cd629ccecd9","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"A recipe for generating 3d worlds from a single image","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:0c058bfa15be00db78fca2b7664b0e59247f7cf7b0a8368ebe2e61ec12a1ee52","observation_id":"9edce66f-3b3c-4440-a622-3b9af687f0cd","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Latent diffusion model without variational autoencoder.arXiv preprint arXiv:2510.15301, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:608c454e32f5f0e66e46206d8853dad85c649c986714d098be23758518404dad","observation_id":"36a22438-d0e2-442f-bff5-9ccc878cb22b","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16512","last_updated":"2024-04-18T04:12:32Z","snapshot_observed_at":"2026-08-17T23:11:03.362702Z","submitted_at":"2023-08-31T07:49:06Z","title":"MVDream: Multi-view Diffusion for 3D Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16512","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Mvdream: Multi- view diffusion for 3d generation.arXiv preprint arXiv:2308.16512, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2308.16512","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:1cc4a28eda6ae7c68940f8ca51745500b2b968651f45c58e16c0d974415e3b78","observation_id":"febed8f3-c62e-47ea-8769-8b05c54db666","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:efc9c717c29552663626f752f1ba5c90a69908571e3836fc08f1267930fa1151","observation_id":"fe3d860c-1d4f-42ee-aa0b-24ab1ed6299f","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:15d95fcec03b315abd1454c1329e79867f2c7a40f3792d2b1eef74381d1f8f47","observation_id":"bd2bd376-8415-4c5e-88fa-c89ecafef589","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04928","last_updated":"2024-11-07T18:07:31Z","snapshot_observed_at":"2026-08-16T13:02:01.454341Z","submitted_at":"2024-11-07T18:07:31Z","title":"DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04928","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Dimensionx: Create any 3d and 4d scenes from a single image with controllable video diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2411.04928","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:c6d7b92c9ad063c6fb94c5223fbb2f5687c8175cfe25970463553d8cac82c452","observation_id":"27b5c168-b5f7-401f-a108-e3ec61d1256b","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16653","last_updated":"2024-03-29T08:39:23Z","snapshot_observed_at":"2026-07-06T16:25:05.493379Z","submitted_at":"2023-09-28T17:55:05Z","title":"DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16653","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Dreamgaussian: Generative gaussian splatting for efficient 3d content creation.arXiv preprint arXiv:2309.16653, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2309.16653","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:e9f9bbe768e7fda389d4911175e0a73a95f592186d8910460967efac1553c2f5","observation_id":"5aca08e2-bdaf-46ff-9883-5b0a0f11bef1","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Neural discrete representation learning.Adv","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:07176d4ab0d5d85062d13a395ce1686f5691cf6b6b27636b7284568f1b71b0dc","observation_id":"7f98a07d-8839-4662-8ff7-063652d095d7","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:e55c96ddb4e7621124a3f5732e8d5ad4879b5f0117e4ce4613df29cddf1d28d6","observation_id":"32ead8e7-b308-4339-8928-12e5a41ba991","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:389b85219f12ff9b2255f9dd91c1f23bb2b6a40d079abea593baaf1998bdce6e","observation_id":"c2bff267-4d36-429f-bc3a-27fcd2b12b62","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:2a27596f6c740858f9507e9cc604f3297459f82d781ed00b6ddbc0d23be667c9","observation_id":"cf136523-4b43-4ff6-8f5c-e477fe8921b5","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13347","last_updated":"2026-03-07T07:01:59Z","snapshot_observed_at":"2026-08-18T07:52:03.034005Z","submitted_at":"2025-07-17T17:59:53Z","title":"$\\pi^3$: Permutation-Equivariant Visual Geometry Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13347","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"π3: Permutation-equivariant visual geometry learning.arXiv preprint arXiv:2507.13347, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2507.13347","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:07bf49622920aa7f531197ebb1a837b47aa97e9305529357aef495e19d77ff55","observation_id":"0aa97812-b7d4-4de0-815f-f634c3273e49","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Pro- lificdreamer: High-fidelity and diverse text-to-3d generation with variational score distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:9a11a59f840e954156bbdecfa6532e16921105b051153caef6a0e001b94e12d3","observation_id":"be77dd03-3894-43a6-87e0-64dab91c0c2a","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE transactions on image processing, 13(4): 600–612, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:fcbe3e8a83581acae019d2133bcb679a5515143e20a67bad7d0cccb9e5681b17","observation_id":"17282fe3-a238-439f-baea-350ccc223453","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-14T21:13:23.101760Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07982","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Ge- ometry forcing: Marrying video diffusion and 3d representation for consistent world modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2507.07982","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:fe052cdd074b21cb647dc21ce425feb7b4a7c82863fe50c8b77f3d0aa91e6b87","observation_id":"e2107027-5ffa-4e39-86b5-b8019e1f3fc9","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Reconfusion: 3d reconstruction with diffusion priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:059c60d7cb9865248273e972a121b5edcbb485f2a916b52ae6144bebbea8c520","observation_id":"711fe5a6-4c24-4d32-8652-0ecd8bc9bee6","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Depthsplat: Connecting gaussian splatting and depth","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:98c771a52e9a0c473969a1b09ff546d1ad25c874f6acb530e5c141e4bf190189","observation_id":"4a062beb-da70-45c1-8f47-d1ef9a893ebc","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Prometheus: 3d-aware latent diffusion models for feed-forward text-to-3d scene generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:3a4ea55a5795075734c9f193032b52d9e975fc5eb525b2ca55434d36a5525850","observation_id":"3a096dff-995c-4aa7-a071-25b4c6a4bfc3","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Reconstruction vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:c93f9483d19b16c8bfb72477cb87d6693fbe60ba371c8c2a328465a2c4acfb06","observation_id":"26ffedac-8ef4-4dac-b2c0-b45c464e7790","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"World action models are zero-shot policies.arXiv preprint arXiv:2602.15922, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:2c450d7049f1ca896003ab55bd7633daab3f1212927a1e87ff53ca0e5e7ca561","observation_id":"26f027ec-9d57-4819-a7b3-fc1fbdb273dd","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Wonderjourney: Going from anywhere to everywhere","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:4790d78f5eeb898d1a1f8adea6e34611d7f39e60befd6172732aa710757185a0","observation_id":"d75d5af1-5cc0-4dd3-ab8a-bfa876b7c5e2","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Wonder- world: Interactive 3d scene generation from a single image","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:095fc12a7e2c18650697c081e329b9fb518faca9b2c65cba4c0bffdc9b198d5c","observation_id":"2839f287-de05-46e6-a958-7899040773b3","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Advances in feed-forward 3d reconstruction and view synthesis: A survey.arXiv preprint arXiv:2507.14501, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:1c619bfaebdbf649f69cfd4847433bd0d6e81ac7eaaebef603d8c9aae8d82b1b","observation_id":"e58dabbf-9292-4cf5-be39-22d98aae12cc","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:2b137600d6fe1f5a92bf185c3ab65b6cb5feab7fcf71f5e77624cfe2e263881f","observation_id":"f7cf1882-91b8-4cfd-8dae-33ea18604bb4","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"The unreason- able effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:d3b9dd6fcd3dac09e65d7c38f9d4de06d860e042bb354615301b82ae04a53f96","observation_id":"02bfc550-75d2-45ff-9d7d-eaa126c4481c","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02319","last_updated":"2024-11-05T06:08:43Z","snapshot_observed_at":"2026-08-16T13:03:04.838761Z","submitted_at":"2024-11-04T17:45:44Z","title":"GenXD: Generating Any 3D and 4D Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02319","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Genxd: Generating any 3d and 4d scenes.arXiv preprint arXiv:2411.02319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2411.02319","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:d80b219d300270cae4d28b7054dc5ccac9715e5f158fd206a6ebef900b126acd","observation_id":"9ad08f3d-be9b-4250-933c-3c717d39ad84","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-08-13T23:51:28.874833Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Diffusion transformers with representation autoencoders.arXiv preprint arXiv:2510.11690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:9ec59141537126bec23c70b8cd2cefacac5b3e771cf0c13eb1250f0938f4ee94","observation_id":"000044d4-64f4-4ef9-bb60-4348ae130c8a","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Stereo magni- fication: learning view synthesis using multiplane images.ACM Trans","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:0dc7ff457fcbdbc0773fdfb6851714071243440ad5601d34c2f5026e21e6e643","observation_id":"96b7fa68-bc50-4e2a-a6bd-8e949685c8df","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":"Aether: Geometric-aware unified world modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:4919619484e3d15e52a40bb17a1c377561c9704bdf5ea424fc68ca5834916665","observation_id":"d8953c77-9d29-4025-8c7f-aa120883129a","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2603.16100."}