{"as_of":"2026-08-13T10:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2e2688b9a1b8d9004c12ed52dfe496c6728182acccfbc4cbf671b4e30b1d739","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:06:09.205961Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14715/citation-record","integrity":"/paper/2411.14715/integrity","json":"/paper/2411.14715/citation-record.json","paper":"/paper/2411.14715"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.01166","last_updated":"2024-03-19T08:22:42Z","snapshot_observed_at":"2026-08-13T04:28:40.955320Z","submitted_at":"2024-02-02T06:20:44Z","title":"A Comprehensive Survey on 3D Content Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01166","snapshot_observed_at":"2026-08-12T15:06:08.869166Z","title":"A comprehensive survey on 3d content generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.869166Z"},"links":{"cited_paper":"/paper/2402.01166","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:2115ea3d584ec3cfe9ef428893239cd5060bcfe8fe912ba91826529b0ae5fcbb","observation_id":"58a48177-60ee-4fdc-a9b5-725dc1b10bd4","resolution":{"observed_at":"2026-08-12T15:06:08.869166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16512","last_updated":"2024-04-18T04:12:32Z","snapshot_observed_at":"2026-07-06T16:12:38.269310Z","submitted_at":"2023-08-31T07:49:06Z","title":"MVDream: Multi-view Diffusion for 3D Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16512","snapshot_observed_at":"2026-08-12T15:06:08.874821Z","title":"Mvdream: Multi- view diffusion for 3d generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.874821Z"},"links":{"cited_paper":"/paper/2308.16512","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:93d8071677b99d8710ef54cd902ca7a0c4b98de7b1405fe5a98190ea4989df56","observation_id":"ab03ce1c-0c6e-4f5b-9e17-ecf0049af528","resolution":{"observed_at":"2026-08-12T15:06:08.874821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16818","last_updated":"2023-10-26T06:54:22Z","snapshot_observed_at":"2026-08-13T05:40:29.620294Z","submitted_at":"2023-10-25T17:50:10Z","title":"DreamCraft3D: Hierarchical 3D Generation with Bootstrapped Diffusion Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16818","snapshot_observed_at":"2026-08-12T15:06:08.879990Z","title":"Dreamcraft3d: Hierarchical 3d generation with bootstrapped diffusion prior,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.879990Z"},"links":{"cited_paper":"/paper/2310.16818","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:6e46f5f6ec0a3bef4fef317b819932ccbda69ebc9be8064cb5b7f90ab28f0715","observation_id":"53913581-a70d-492d-ba92-411094513296","resolution":{"observed_at":"2026-08-12T15:06:08.879990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05034","last_updated":"2024-03-08T04:25:29Z","snapshot_observed_at":"2026-08-13T00:59:35.990568Z","submitted_at":"2024-03-08T04:25:29Z","title":"CRM: Single Image to 3D Textured Mesh with Convolutional Reconstruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05034","snapshot_observed_at":"2026-08-12T15:06:08.885295Z","title":"Crm: Single image to 3d textured mesh with convolutional reconstruction model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.885295Z"},"links":{"cited_paper":"/paper/2403.05034","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:43376573a7f541dcb2b892061807668ef71077620789e49507c2ba0fee45f339","observation_id":"12200ea4-2b8b-4f1c-a655-ef1cb38aeb84","resolution":{"observed_at":"2026-08-12T15:06:08.885295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.890661Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.890661Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:2ff4e2d7d303973f3461e3c367fb44336f991afcdbf4e83022c45f36c7b25340","observation_id":"17bbf6d2-9bdd-4f05-a353-e177767ba10c","resolution":{"observed_at":"2026-08-12T15:06:08.890661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.895370Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.895370Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:3ceb1dbfca99a770a328c93727a8ee4a42c748a72e2dc76548706267556a79ec","observation_id":"61fc271f-8f2d-437c-b16b-4651d3bb08b3","resolution":{"observed_at":"2026-08-12T15:06:08.895370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-12T15:06:08.900106Z","title":"Hierarchical text-conditional image generation with clip latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.900106Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:d8599e6c8ab1f75fcff753e957a3679ea47c39e9c4ce64fedd955e1785162f69","observation_id":"620e5ff1-740d-4c29-9519-64e408ceb3cd","resolution":{"observed_at":"2026-08-12T15:06:08.900106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.904651Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.904651Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:1c4cf57c947c072c6da92b2872d28db4ba08176bf012867aa0d32d75e2c76bda","observation_id":"f76566cb-5053-4abd-a366-4928b4792962","resolution":{"observed_at":"2026-08-12T15:06:08.904651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:10.183031Z","title":"Fantasia3d: Disentangling geometry and appearance for high-quality text-to-3d content creation,","venue":null,"work_id":"e8881e7c-f7c5-4387-b75c-8808f6d09528","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.909154Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:67f6587996064e289b786e72b6addccaf0bf7065836a7d5d354b65f24ee184ef","observation_id":"f97915fa-8ab2-4c8c-9415-1a6793b0dd37","resolution":{"observed_at":"2026-08-12T15:06:10.188284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:10.166837Z","title":"Score jacobian chaining: Lifting pretrained 2d diffusion models for 3d generation,","venue":null,"work_id":"a5e57834-72ef-4ff7-b28c-2d2dad8dd2f3","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.913956Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:097565ccc4869fc0da3841ec476fb8689ed72372223d4fca90481865129e5e4a","observation_id":"4b764b39-6668-41aa-8e23-6dc37b695d8c","resolution":{"observed_at":"2026-08-12T15:06:10.172404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:10.151693Z","title":"Consistent3d: Towards consistent high-fidelity text-to-3d generation with deterministic sampling prior,","venue":null,"work_id":"a7e85f32-0c33-47a6-aec0-44bf8e3511d2","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.918983Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:a0d887e42c20dc9280a6a9852691722dfaf2afb5d31413931b44e6e2ea22b8f6","observation_id":"b4f8d8df-8334-450c-98b3-f36758c75bda","resolution":{"observed_at":"2026-08-12T15:06:10.156598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.923377Z","title":"Score distillation sampling with learned manifold corrective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.923377Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:658ea5239714c9ed1a720622c3b05f5fef9c1e77508f3d68041dfd7b2f518557","observation_id":"0795ee22-0282-4593-956c-5be708aa389c","resolution":{"observed_at":"2026-08-12T15:06:08.923377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00909","last_updated":"2024-03-29T18:04:37Z","snapshot_observed_at":"2026-08-13T04:50:40.115109Z","submitted_at":"2023-12-31T22:47:06Z","title":"Taming Mode Collapse in Score Distillation for Text-to-3D Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00909","snapshot_observed_at":"2026-08-12T15:06:08.927827Z","title":"Taming mode collapse in score distillation for text-to-3d generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.927827Z"},"links":{"cited_paper":"/paper/2401.00909","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:0c2816f018f877f5e6711d429aece890b376fa533d82bf2eb7254d4323533797","observation_id":"ccef9134-5c18-47b1-a5ba-466e9707076e","resolution":{"observed_at":"2026-08-12T15:06:08.927827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.932799Z","title":"Prolific- dreamer: High-fidelity and diverse text-to-3d generation with variational score distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.932799Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:094116371613d4946abe289d028965ec9a2387ee176b27953a9ed0d227275854","observation_id":"69cf0a3c-c85f-4c2a-aff1-6f56c6d6075b","resolution":{"observed_at":"2026-08-12T15:06:08.932799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.937467Z","title":"Text2mesh: Text-driven neural stylization for meshes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.937467Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:e9605cc346bd9d3a9c30b0bfd0274d8d3f84247d0a78b7f49fec73b8ab1e1f8c","observation_id":"f8e4a336-e408-42c7-81ad-1da07bd3d4e9","resolution":{"observed_at":"2026-08-12T15:06:08.937467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:10.107329Z","title":"Cad: Photorealistic 3d generation via adversarial dis- tillation,","venue":null,"work_id":"78c59176-6a70-4a31-b46b-03747ca3535d","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.941969Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:db414e0929c086c2ed3d470018d9a183d1006d86f076826dc84c6b6d5134f24d","observation_id":"325a509d-8d1c-4246-9f42-31754ffbae7b","resolution":{"observed_at":"2026-08-12T15:06:10.112681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16653","last_updated":"2024-03-29T08:39:23Z","snapshot_observed_at":"2026-07-06T16:25:05.493379Z","submitted_at":"2023-09-28T17:55:05Z","title":"DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16653","snapshot_observed_at":"2026-08-12T15:06:08.946191Z","title":"Dreamgaussian: Generative gaussian splatting for efficient 3d content creation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.946191Z"},"links":{"cited_paper":"/paper/2309.16653","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:5965702c4a47cc5c638a1a885b6e5c96811a8a708f6eece7e84192a87790ad00","observation_id":"25272064-4dff-4f97-8c82-69108bc4d387","resolution":{"observed_at":"2026-08-12T15:06:08.946191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.950956Z","title":"Make-it-3d: High-fidelity 3d creation from a single image with diffu- sion prior,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.950956Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:c8afc9a200db1949595299ba0961369d3f51d19d8edaabd0b2774a320da3de3d","observation_id":"c7f2fbb1-06e5-4912-8725-19b4e7dafbb6","resolution":{"observed_at":"2026-08-12T15:06:08.950956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.955796Z","title":"Realfusion: 360deg reconstruction of any object from a single image,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.955796Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:7d7763928417fec7e83fe265c4d125a784d2c2b21bc6e40e9bcede248e592508","observation_id":"b2bb9bbb-7f2b-4f0e-b993-bdd9af1513a1","resolution":{"observed_at":"2026-08-12T15:06:08.955796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.960132Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.960132Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:be2a69db8b7dc4510d770acf939a1fd7aa0b1e5c7e8b07f910583d55c77b8f09","observation_id":"5fdb51db-88ad-4a3e-bb6e-2ea921db3796","resolution":{"observed_at":"2026-08-12T15:06:08.960132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:10.062654Z","title":"Any-to-any generation via composable diffusion,","venue":null,"work_id":"8af14207-01a9-4a9d-b504-cb9ceb30b65d","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.964619Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:bef6779f965e28acd5b5f39690767511bd5a9e89316629238939a4d2b744ae0d","observation_id":"e3e7c479-c0d2-4dae-8828-aafe5bf81840","resolution":{"observed_at":"2026-08-12T15:06:10.067350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:10.046552Z","title":"Dreamfusion: Text- to-3d using 2d diffusion,","venue":null,"work_id":"46570cfc-3c91-4a81-8af0-53f99e4e8343","year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.969465Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:892de244ad1020d870664516b4e4b6080053eca86aa1500fdbc681ecde68ca5c","observation_id":"c8402f07-2dc1-4427-b397-75901738a4e1","resolution":{"observed_at":"2026-08-12T15:06:10.051830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.973776Z","title":"Zero-1-to-3: Zero-shot one image to 3d object,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.973776Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:6e512f6c2accd91fc8ebd1fa10a334b80a86a4b235509070a2d799590281fc31","observation_id":"f1a2d67b-b25a-4a63-90e5-9a02c3543115","resolution":{"observed_at":"2026-08-12T15:06:08.973776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.978522Z","title":"Mip-nerf: A multiscale representation for anti- aliasing neural radiance fields,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.978522Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:f27d1bc25984b00ad24903c13b8c713a2de219ea24fc29a6930bff670cb15fce","observation_id":"8dad3f68-d79e-478a-9369-ab314585df38","resolution":{"observed_at":"2026-08-12T15:06:08.978522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.982694Z","title":"Instant neural graphics primitives with a multiresolution hash encoding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.982694Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:f69c3744b4925a4dcc8977faf504987bc7c4ac97497f78ccf5a7c86a1ec1a8c7","observation_id":"1ea507c1-f81b-471a-962c-4a8e3753c7ef","resolution":{"observed_at":"2026-08-12T15:06:08.982694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.999635Z","title":"Deep marching tetrahedra: a hybrid representation for high-resolution 3d shape synthe- sis,","venue":null,"work_id":"ec849efd-6786-448c-b69e-76752f23c0ad","year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.986890Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:0c01b0b3152cd1802f8624671e77f508ae20a6ee0f14d7220aeeee21528cd286","observation_id":"8edee7e6-22fa-4a4a-b252-dad2923d0e82","resolution":{"observed_at":"2026-08-12T15:06:10.005037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.991441Z","title":"Diffusion models: A comprehensive survey of methods and applications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.991441Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:2fff8787c1a9720d9487b177e786a104016ec4664c8db86bb6f93150c02a801b","observation_id":"f7b5b759-ce9c-40ce-a036-366ed4553002","resolution":{"observed_at":"2026-08-12T15:06:08.991441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-12T15:06:08.995743Z","title":"Score-based generative modeling through stochastic differ- ential equations,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.995743Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:8a70f7c7877ab93e1bd8a018a87f1eda29f916c207f62667478652187e4267cf","observation_id":"26f0b8c1-cdb7-4c16-8e8d-f4470e745cb3","resolution":{"observed_at":"2026-08-12T15:06:08.995743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.000129Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.000129Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:00d4898141c3b9591b12a09d52f46319b0907545a04cd86ec4c831fa2ff639af","observation_id":"d15f644d-4a79-416d-8021-b2b826610ef0","resolution":{"observed_at":"2026-08-12T15:06:09.000129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.004704Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.004704Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:634447dd2ef774c3791ed160a67d20ceb2e1b4ae346233c0af74621c9eac502d","observation_id":"c1627c15-bda4-46ff-af79-dc587a4ce8b7","resolution":{"observed_at":"2026-08-12T15:06:09.004704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.953660Z","title":"Vector quantized diffusion model for text-to-image synthesis,","venue":null,"work_id":"af999670-f8f2-4950-844b-2bd74d3b0586","year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.008713Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:73b6bab074d5b1cb8c1a29c99b2fa3dd412cc9bc4b9f8ba84e26e3d5a402ec2b","observation_id":"c752e858-f635-414a-8e67-cda7edfef26b","resolution":{"observed_at":"2026-08-12T15:06:09.959853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.013153Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.013153Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:3ac9024aa00d0f6ea0734019919c8e2c13df6032e4bc4ee9df544fc91f34e180","observation_id":"7ea2d145-5880-468b-87c6-958f42bd2fde","resolution":{"observed_at":"2026-08-12T15:06:09.013153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.928721Z","title":"Improving diffusion-based image synthesis with context pre- diction,","venue":null,"work_id":"af4f68d1-77b7-4679-a3dd-ef4080b1c250","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.017599Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:e6cc254b6b9cf12f4353e097d95c6f7645555836eced7f2a64518f6c3359b393","observation_id":"b60c36b8-a853-4783-861a-7a0944dabc67","resolution":{"observed_at":"2026-08-12T15:06:09.933664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.913489Z","title":"Shifted diffusion for text-to-image generation,","venue":null,"work_id":"d6e71ac5-89e2-4430-badf-212ea8fab627","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.022255Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:aff2ec62bee8bd6e00c55e23a1f0426139227fab0f69d08e072404c668f8652e","observation_id":"a0d02342-8316-442f-8a2d-ba0a69d5d526","resolution":{"observed_at":"2026-08-12T15:06:09.918543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.027051Z","title":"Text2video-zero: Text-to-image diffusion models are zero-shot video generators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.027051Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:cf9bf1f23a8469ee308030206aba4ba0107be08802764d0c6c7e5269e5d8a2ad","observation_id":"91f627df-ae0e-4541-a448-a3415e41534e","resolution":{"observed_at":"2026-08-12T15:06:09.027051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.888254Z","title":"Videofusion: Decomposed diffusion models for high-quality video generation,","venue":null,"work_id":"0cea5d64-1d83-4771-831e-1556ed57a3b7","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.032414Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:4d5544fabed8fc5426a9c37af32fb504f109bf183d6c77aeedff38db17014ea4","observation_id":"76e529bc-9e94-47fe-9c0b-8ded0e7a27de","resolution":{"observed_at":"2026-08-12T15:06:09.893071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.037210Z","title":"Vidm: Video implicit diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.037210Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:83698a8b287e929fc8b6225200a18b61d111c89152bc3fd75430ab59d5bb35d2","observation_id":"f62fb30d-c7dc-42a7-be9b-2f2feddca30b","resolution":{"observed_at":"2026-08-12T15:06:09.037210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-13T10:04:30.993324Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-12T15:06:09.041883Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.041883Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:33e24faba5e56cf914c3024c1de6d03222a5297d639bf25f630464912e755320","observation_id":"402b17df-3908-41c7-a353-1bbe49809c2c","resolution":{"observed_at":"2026-08-12T15:06:09.041883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.862618Z","title":"Prodiff: Progressive fast diffusion model for high-quality text-to-speech,","venue":null,"work_id":"f32b08df-f4c3-4afb-91d0-b67be00b2666","year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.046471Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:114e23aa3e2aa46f91efcd869a06fbd3b8079d793a6efe358cf9eff85d87743f","observation_id":"cbc742d2-1eef-4fd2-b7d4-148dec3d0f0a","resolution":{"observed_at":"2026-08-12T15:06:09.867485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.846763Z","title":"Taming diffusion models for audio-driven co-speech gesture generation,","venue":null,"work_id":"a3252175-02e0-4955-8acb-a6e21667584d","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.050887Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:3a32917d6d80fe7b2b334240063c3e1b916c79bb4cc94879b73758ae4ca5d41c","observation_id":"f53e03e5-aef3-4931-98b6-8cb45fd5232d","resolution":{"observed_at":"2026-08-12T15:06:09.851715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.055185Z","title":"Speech enhancement and dereverberation with diffusion-based genera- tive models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.055185Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:63cbff60c5fa7d63e2f4657aeb8899ffcb7a5982ffa3a230cbcc3d421028cf70","observation_id":"1c8bda65-74c7-4d6c-b79e-174173688c26","resolution":{"observed_at":"2026-08-12T15:06:09.055185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.821620Z","title":"Storm: A diffusion-based stochastic regeneration model for speech enhancement and dereverberation,","venue":null,"work_id":"04e78155-0e28-4f94-b5a2-ea8ea8f837b3","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.059549Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:d3e0a3f2ceef6fb871efdeef9fefbb31c7c3f2da3154b801fb3ea668835e3c74","observation_id":"c1009c3e-ef11-4e4d-a58d-d449c68cef03","resolution":{"observed_at":"2026-08-12T15:06:09.826556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17075","last_updated":"2024-06-13T17:59:14Z","snapshot_observed_at":"2026-08-13T05:40:14.722210Z","submitted_at":"2023-10-26T00:36:03Z","title":"HyperFields: Towards Zero-Shot Generation of NeRFs from Text","version":3},"cited_work":{"arxiv_id":"2310.17075","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.17075","snapshot_observed_at":"2026-08-12T15:06:09.361876Z","title":"HyperFields: Towards Zero-Shot Generation of NeRFs from Text","venue":"cs.CV","work_id":"f7ca0ddd-3316-4af4-bb42-e426dc09480a","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.064123Z"},"links":{"cited_paper":"/paper/2310.17075","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:cb334d564a635a71b56a068b8468aae9e31cbade60ba07e32164c26294a7b214","observation_id":"ffa2b3a8-f75f-4826-80b1-5a5436ff3713","resolution":{"observed_at":"2026-08-12T15:06:09.369297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.805885Z","title":"Texfusion: Synthesiz- ing 3d textures with text-guided image diffusion models,","venue":null,"work_id":"5297f38e-41d9-40ef-a0e1-dd0c5421393d","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.068827Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:d6c4184f8cdefd58aaeb56ebda5fc457e7a37a2a17149a57c9224206b4557557","observation_id":"4046219f-73da-4020-8c5c-9b4648149132","resolution":{"observed_at":"2026-08-12T15:06:09.810996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.072978Z","title":"Luciddreamer: Towards high-fidelity text-to-3d generation via interval score matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.072978Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:d4c83a519abde7398aef751aba5ffa6e058bf0da40b32c07ce9b8238af066186","observation_id":"96ec87b7-777f-414e-8707-6f16341013e7","resolution":{"observed_at":"2026-08-12T15:06:09.072978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.780947Z","title":"Scenetex: High-quality texture synthesis for indoor scenes via diffusion priors,","venue":null,"work_id":"ff7b15c0-d3e6-4abf-81fc-2aae89ac9e5f","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.077126Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:19bd20ad5708871e611e54e4587d5dcaafe344807ecf664e9392ce59e489c1c9","observation_id":"c969aad8-aa71-4917-aaf1-439b7ece00dc","resolution":{"observed_at":"2026-08-12T15:06:09.785723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.081939Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.081939Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:bb672617bc6683ca16fff38d52e72468d5691755b79dbd451542fc0a6cc4543a","observation_id":"152a28b7-d752-4fc1-9678-ea58cfdeb0b9","resolution":{"observed_at":"2026-08-12T15:06:09.081939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03453","last_updated":"2024-04-15T10:28:44Z","snapshot_observed_at":"2026-08-12T22:52:54.817720Z","submitted_at":"2023-09-07T02:28:04Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03453","snapshot_observed_at":"2026-08-12T15:06:09.086742Z","title":"Syncdreamer: Learning to generate multiview-consistent images from a single-view image,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.086742Z"},"links":{"cited_paper":"/paper/2309.03453","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:93d24904a6a23248209a432ff6ced30edd0275a833d1aca96001de4f50d4e3c8","observation_id":"9c6ebb7f-ce0b-4c56-aee1-5138a6bc3ecd","resolution":{"observed_at":"2026-08-12T15:06:09.086742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.755852Z","title":"Objaverse: A universe of annotated 3d objects,","venue":null,"work_id":"984c7fd8-914b-4598-97ff-2ffb575e06bf","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.091375Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:2b6608c9b1dafe0d2f1db81a127409f8512d31e33b5e2dacb30d3e2c59b18a4a","observation_id":"a1758340-b61d-41f2-8a1f-7a3ab483c63f","resolution":{"observed_at":"2026-08-12T15:06:09.760556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.741359Z","title":"Objaverse-xl: A uni- verse of 10m+ 3d objects,","venue":null,"work_id":"e89f68a3-9000-4d6e-8326-ca048f39176e","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.095751Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:46db531dc109b5b30db28414782dcb559cd654d01234840396fec2143b83b4b5","observation_id":"326f62a7-0b69-4885-9f52-31750f438126","resolution":{"observed_at":"2026-08-12T15:06:09.745915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.100545Z","title":"Omnivore: A single model for many visual modalities,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.100545Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:c2a4e9fa1d2a97b89595fa2e5fcac2d92420e7dcfc7fa6479fd9eff21a6c582d","observation_id":"c960da25-e218-4a06-b48b-62718270d6cc","resolution":{"observed_at":"2026-08-12T15:06:09.100545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12993","last_updated":"2021-11-25T10:01:05Z","snapshot_observed_at":"2026-07-06T12:12:06.958305Z","submitted_at":"2021-11-25T10:01:05Z","title":"PolyViT: Co-training Vision Transformers on Images, Videos and Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12993","snapshot_observed_at":"2026-08-12T15:06:09.105043Z","title":"Polyvit: Co-training vision transformers on images, videos and audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.105043Z"},"links":{"cited_paper":"/paper/2111.12993","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:38ef76f54c4c6348831fb1fd26c2583817abb663e9bfa55d8743d395f9e63ae5","observation_id":"2ca5aaf4-4b5a-41ac-b0b2-5f6cc8611c7c","resolution":{"observed_at":"2026-08-12T15:06:09.105043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.716854Z","title":"Look, listen and learn,","venue":null,"work_id":"9784578a-0b94-4f5d-bf22-f8013088f21d","year":2017},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.109485Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:cccf057b7719e1aca6fe506cbd1ad9ca3aaa4e8345ed1a0109ec522df1c2c481","observation_id":"d455fe45-28c2-4493-80df-62d3e04ce503","resolution":{"observed_at":"2026-08-12T15:06:09.721471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.702544Z","title":"Omnimae: Single model masked pretraining on images and videos,","venue":null,"work_id":"062ac418-fd13-4bd6-8113-dd79fb7cb4d6","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.113934Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:24b7f60bbebdd9ff55ce142277f2040df2ae4f6f33e1ad109eae21ac11c42f24","observation_id":"66dd7062-c45f-4416-992a-93c83159a1cc","resolution":{"observed_at":"2026-08-12T15:06:09.707135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.687133Z","title":"Audio-visual instance discrimination with cross-modal agreement,","venue":null,"work_id":"4cc6f8bf-ba79-4e59-ae0a-43cb4353e9cc","year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.118401Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:4ea306952b6cac28c941deb972e786b998d8a908cb4e60683819c6b91e548548","observation_id":"c2ff91f4-95fa-48f7-83a4-1192399cb610","resolution":{"observed_at":"2026-08-12T15:06:09.692449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.122829Z","title":"Contrastive multiview coding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.122829Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:ce4abba5d23ca97f1d212c1f3601f3ba4d96dece5f5928e5c29a535782c2d7d0","observation_id":"f68eb4b9-c82a-4258-a31b-a1e0edbbc09b","resolution":{"observed_at":"2026-08-12T15:06:09.122829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.662337Z","title":"Bevt: Bert pretraining of video transformers,","venue":null,"work_id":"56cc21dd-7bdb-4803-8ad6-14f21cb9bb92","year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.127052Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:56f2dbeabe4b1ea4ddeb63633359efd4f57765246f95173554fbb7636ca25573","observation_id":"9597dfb0-6242-4426-af2a-9c4b64904947","resolution":{"observed_at":"2026-08-12T15:06:09.667448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T02:40:23.887636Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T15:06:09.131536Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.131536Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:dbea3ce2e6a2726feb85dc0025a2a893c820d41ce593a7cab5485baefbfe7234","observation_id":"f8a5fd88-b8d2-4d96-b629-78a21a56a2e9","resolution":{"observed_at":"2026-08-12T15:06:09.131536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.136242Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.136242Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:832ea732a9b8654509ce6552d2fcb089edc7894e96522d2372f04193571d62c9","observation_id":"ccd53418-b010-4471-988f-95f55e04344f","resolution":{"observed_at":"2026-08-12T15:06:09.136242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.140586Z","title":"Unifying vision-and-language tasks via text generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.140586Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:eada3bd810b2f8fc882b6fd2c5a82ea7a05b6d1f2dcdf7f7282f56ace3a34300","observation_id":"e313d8b7-e60b-4394-84aa-ce78ae8bd06c","resolution":{"observed_at":"2026-08-12T15:06:09.140586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.625492Z","title":"Merlot: Multimodal neural script knowledge models,","venue":null,"work_id":"71da03f4-be69-49c5-863d-4d59ce30bcb6","year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.145453Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:50b032992c8876c35e7a09d37aa9e33e8ff4ce840fde66ed0f2199c345ed619c","observation_id":"cbc33707-dc53-4f18-9fd3-00853989f456","resolution":{"observed_at":"2026-08-12T15:06:09.630843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.608983Z","title":"Multimodal few-shot learning with frozen language models,","venue":null,"work_id":"5218e40b-49c8-4fc0-8ee8-9b37d4c7abcd","year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.150092Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:4adedde30d7a976fae250ce15b9d3d528fe7217752ec2ab6a8be5cde5d6e3b26","observation_id":"7a20f2a2-126e-4a0b-b512-feebae9509d2","resolution":{"observed_at":"2026-08-12T15:06:09.613813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12327","last_updated":"2024-04-26T01:50:55Z","snapshot_observed_at":"2026-08-13T05:20:45.229059Z","submitted_at":"2023-11-21T03:40:09Z","title":"Enhancing Visual Grounding and Generalization: A Multi-Task Cycle Training Approach for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12327","snapshot_observed_at":"2026-08-12T15:06:09.154447Z","title":"Vilam: A vision-language model with enhanced visual grounding and generalization capability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.154447Z"},"links":{"cited_paper":"/paper/2311.12327","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:b32159757505a35b3d06e21c75be7a30a5e8beb327e936226a5f0b090eca64e0","observation_id":"d1262267-e2dc-430e-81d1-5e465e451c67","resolution":{"observed_at":"2026-08-12T15:06:09.154447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.593704Z","title":"Tvlt: Textless vision- language transformer,","venue":null,"work_id":"7f469d70-1a3c-4fc9-8dd7-9a01023c37af","year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.159386Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:961ad9bc1be685e8a08684a7e2b9ea2ad3895f801f0aad82d959724f41360de9","observation_id":"91929523-abef-4ee5-bd5f-f24e179c6f8b","resolution":{"observed_at":"2026-08-12T15:06:09.598574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.578205Z","title":"i-code: An integrative and composable multimodal learning framework,","venue":null,"work_id":"8336f4af-4eb6-428f-ad2e-7debe8a24c7b","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.164581Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:74d5829dc108e3ff8579c49fd155bdd07766acbc24356dc8a86f59921f5aafa7","observation_id":"24568667-8c93-4b8e-ae8e-e39e705dc7ad","resolution":{"observed_at":"2026-08-12T15:06:09.583209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.561812Z","title":"Merlot reserve: Neural script knowledge through vision and language and sound,","venue":null,"work_id":"44303693-34f2-4180-a552-78b7513e5f1a","year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.169023Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:dde6cf117f86daa5c4d96f4e1544c47b6b79e60190442f424705c31392685b39","observation_id":"bed8ef28-4106-4293-8a4c-2788d6ce3475","resolution":{"observed_at":"2026-08-12T15:06:09.566661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.546602Z","title":"Codi-2: In-context interleaved and interactive any-to-any generation,","venue":null,"work_id":"7317a12a-0df4-4bcf-af0b-ad9c2db6a4e2","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.173948Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:0e48b99f4bfa2b66a6b2254c7efc43cfaa25f4071351c2914a94bcfe95965695","observation_id":"278ba3f8-a417-4148-ba47-941a6f9cfa78","resolution":{"observed_at":"2026-08-12T15:06:09.551448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.178506Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.178506Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:3c1d29e8acfef69dcef0722c94ec54b7bd709b288f4bd4b9e773c85e7382a929","observation_id":"0d7bda40-a9b7-4578-9fab-bd0def96b275","resolution":{"observed_at":"2026-08-12T15:06:09.178506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-12T15:06:09.182850Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.182850Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:0bf4c9b86f2e5aca7b7b96c1443275acf6b120694a60ce70a659156196c36421","observation_id":"14becb8c-e340-404d-b335-eae95a2b7a86","resolution":{"observed_at":"2026-08-12T15:06:09.182850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-11T17:44:55.630525Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-12T15:06:09.187306Z","title":"Clipcap: Clip prefix for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.187306Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:19aab975aa9e4264bba69e795b7621a290326725c58207e46331fc7b52eafe18","observation_id":"165f4ef6-ebb0-441c-b50c-e4cf30ccecd4","resolution":{"observed_at":"2026-08-12T15:06:09.187306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-12T15:06:09.192123Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.192123Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:529482af91992621d25f274f87c691ebbb39c172d0c01ecbf4ee853a1e562105","observation_id":"ffde865b-5216-4021-805b-079c3d710f1d","resolution":{"observed_at":"2026-08-12T15:06:09.192123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18766","last_updated":"2024-03-11T06:14:31Z","snapshot_observed_at":"2026-08-13T06:33:05.598021Z","submitted_at":"2023-05-30T05:56:58Z","title":"HiFA: High-fidelity Text-to-3D Generation with Advanced Diffusion Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18766","snapshot_observed_at":"2026-08-12T15:06:09.196597Z","title":"Hifa: High-fidelity text-to- 3d generation with advanced diffusion guidance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.196597Z"},"links":{"cited_paper":"/paper/2305.18766","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:78f375bbbe13904a1762127f54367d5994aa402a44c7309cc08e8c092e30a1cb","observation_id":"32346f7b-7d32-4e2c-bbde-806ea81e4236","resolution":{"observed_at":"2026-08-12T15:06:09.196597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.201401Z","title":"Magic3d: High-resolution text-to- 3d content creation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.201401Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:a66b97d3f402c8b81f31091f7bd4cdc910e9b34df2da58d4ba24e333008e9055","observation_id":"93f1e07f-3939-4189-b9d5-5a20c346064f","resolution":{"observed_at":"2026-08-12T15:06:09.201401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.513387Z","title":"threestudio: A unified framework for 3d content generation,","venue":null,"work_id":"aa09d1f9-e0df-4566-b478-934833e5701d","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.205961Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:13056c6fa9e5b7748c7e60e11153919740fb2f345b6f391b17b4d83bc8001ea6","observation_id":"b6c33e85-a032-46af-9e58-f116ec26e3f9","resolution":{"observed_at":"2026-08-12T15:06:09.518344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T06:27:05.945960Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2411.14715."}