{"as_of":"2026-08-10T02:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee8ebb74fe6bfb527a1aa85d4060d578c3f9c66f2d9010b410a4903a6db90559","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:10:34.667840Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T07:34:02.473153Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-09T22:54:16.471407Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"cited_work":{"arxiv_id":"2508.20470","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20470","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Droplet3d: Commonsense pri- ors from videos facilitate 3d generation","venue":null,"work_id":"72f04e7f-70c5-4ce7-bd31-25fee11577f5","year":2025},"citing_paper":{"arxiv_id":"2604.20539","last_updated":"2026-04-22T13:18:22Z","snapshot_observed_at":"2026-07-30T05:21:39.901794Z","submitted_at":"2026-04-22T13:18:22Z","title":"Animator-Centric Skeleton Generation on Objects with Fine-Grained Details","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T22:50:07.371117Z"},"links":{"cited_paper":"/paper/2508.20470","citing_paper":"/paper/2604.20539"},"observation_digest":"sha256:25ecaa45e7202c005620ec76e993b4a0d107f1e2e46d3b9483db19592fde9405","observation_id":"634c3c39-3fa9-430c-9b76-fe92a0b5a2eb","resolution":{"observed_at":"2026-05-09T22:54:16.472675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20470","snapshot_observed_at":"2026-07-12T07:34:02.473153Z","title":"arXiv preprint arXiv:2508.20470 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02712","last_updated":"2026-07-02T18:56:22Z","snapshot_observed_at":"2026-08-07T19:41:57.174465Z","submitted_at":"2026-07-02T18:56:22Z","title":"Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T07:34:02.473153Z"},"links":{"cited_paper":"/paper/2508.20470","citing_paper":"/paper/2607.02712"},"observation_digest":"sha256:7f484aa239e42ce65cb41dd3e5d119ae136fcf5b53feac2658c91cfa47bfa5b3","observation_id":"0d5b7bb3-cdb4-416f-85e3-ffbda26acdbe","resolution":{"observed_at":"2026-07-12T07:34:02.473153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20470/citation-record","integrity":"/paper/2508.20470/integrity","json":"/paper/2508.20470/citation-record.json","paper":"/paper/2508.20470"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.473923Z","title":"Cogvideox-fun","venue":null,"work_id":"127e75ce-9dcc-4818-be02-a78c47142768","year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.309181Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:24926292ec995b23e96d785797f14719bc82cb6ccf72056f203528a4991e14a5","observation_id":"cdb88eb0-d696-42d4-8975-d7f79a52a4a1","resolution":{"observed_at":"2026-08-05T15:10:35.477185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T15:10:34.412028Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.412028Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:8dbce556b26a10eee6811bb62acb7fcf3f38dc0224dc8b5e31aee033413d8cc8","observation_id":"038ae0e0-fb70-4c88-b119-cc85144b74cb","resolution":{"observed_at":"2026-08-05T15:10:34.412028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03012","last_updated":"2015-12-09T19:42:48Z","snapshot_observed_at":"2026-08-07T11:28:03.211074Z","submitted_at":"2015-12-09T19:42:48Z","title":"ShapeNet: An Information-Rich 3D Model Repository","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03012","snapshot_observed_at":"2026-08-05T15:10:34.416626Z","title":"Shapenet: An information-rich 3d model repository","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.416626Z"},"links":{"cited_paper":"/paper/1512.03012","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:343f2163a674c7ce172ebd174147f9b16beffa6057b31d6807c7c0e47155721c","observation_id":"15a7a203-0b00-42e4-9124-10300e28d5b0","resolution":{"observed_at":"2026-08-05T15:10:34.416626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06738","last_updated":"2024-03-11T14:03:36Z","snapshot_observed_at":"2026-08-09T00:18:19.629481Z","submitted_at":"2024-03-11T14:03:36Z","title":"V3D: Video Diffusion Models are Effective 3D Generators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06738","snapshot_observed_at":"2026-08-05T15:10:34.420320Z","title":"V3d: Video diffusion models are effective 3d generators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.420320Z"},"links":{"cited_paper":"/paper/2403.06738","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:53e7580c13d10204d2e7dbb7f586409aa6be9b370732ab97c3980b9513abfb0f","observation_id":"df4cb201-3849-473c-ab08-4c7d8da7ce65","resolution":{"observed_at":"2026-08-05T15:10:34.420320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13384","last_updated":"2023-11-23T11:40:16Z","snapshot_observed_at":"2026-08-09T05:30:44.065605Z","submitted_at":"2023-11-22T13:27:34Z","title":"LucidDreamer: Domain-free Generation of 3D Gaussian Splatting Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13384","snapshot_observed_at":"2026-08-05T15:10:34.423991Z","title":"Lu- ciddreamer: Domain-free generation of 3d gaussian splatting scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.423991Z"},"links":{"cited_paper":"/paper/2311.13384","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:33a795bdca265f65eeaabc5b10daea3ec39cea307e1decf6964bb3d84104badf","observation_id":"4aedacee-1980-4c7c-917e-1a2627eb6f77","resolution":{"observed_at":"2026-08-05T15:10:34.423991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.431666Z","title":"Objaverse-xl: A universe of 10m+ 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.431666Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:ae78be95463f11be119f820ad8f75c11229c35952a0cf0864c22680a1a315eaa","observation_id":"eb9a176c-7e88-48d8-a660-86665ff3f2ac","resolution":{"observed_at":"2026-08-05T15:10:34.431666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.434540Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.434540Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:134b8fd7d590a0eb20718a92414081a81f97d9d16ba75e1d51bac938a65d30b5","observation_id":"d06bf7e9-5878-410d-b685-315402876487","resolution":{"observed_at":"2026-08-05T15:10:34.434540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.450862Z","title":"Anymate: A dataset and baselines for learning 3d object rigging","venue":null,"work_id":"d0474ff5-d34b-4c0d-9532-234ee527fceb","year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.437668Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:489a08e83d90cd3c02dc7ab8e74acb21657d6ff8047fa13c55cf6a569dad708e","observation_id":"1c6ece97-f254-4715-961b-dbf1ba133a08","resolution":{"observed_at":"2026-08-05T15:10:35.454425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T15:10:34.440764Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.440764Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:3a4a8abde9d22d35239236e2028b4fcdd88d8e05099637c1c7db58669a3b7290","observation_id":"19effd8d-d214-47d5-95bf-bc6f0dd197a3","resolution":{"observed_at":"2026-08-05T15:10:34.440764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.441117Z","title":"Google scanned objects: A high-quality dataset of 3d scanned household items","venue":null,"work_id":"a53eff55-8e5f-4932-9cdc-f174e69f12ef","year":2022},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.444251Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:2df7fd1cc46773b21edf2f5844e231e1d50e2a569e3734f6f3d68c89932ed420","observation_id":"455e98bc-a6fa-44bc-898e-bb2f1b00653b","resolution":{"observed_at":"2026-08-05T15:10:35.444466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-05T15:10:34.447593Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.447593Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:5d2efe7adb3f57769579a4669b0de19f83844867fa147a34d9f651231c99fc80","observation_id":"76c09b22-09ef-4482-a256-c8677765ca0e","resolution":{"observed_at":"2026-08-05T15:10:34.447593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-05T15:10:34.450897Z","title":"Video-r1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.450897Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:0538d224b099b917b889a0a62474304e33d31cc92f27a3a032cc968ef30b2a3b","observation_id":"17e3b382-9ebc-4316-925c-107e4111cbd6","resolution":{"observed_at":"2026-08-05T15:10:34.450897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.431551Z","title":"3d-future: 3d furniture shape with texture","venue":null,"work_id":"8fedfefa-b40d-4a60-8cd7-803ea3ae70e4","year":2021},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.453727Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:e9f9bf8c1acc3e6dd24d24c9d57a2a59a5c11cf1566de84703314c416390a57f","observation_id":"00056075-ff47-423b-9e10-f36030e75984","resolution":{"observed_at":"2026-08-05T15:10:35.434841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T15:10:34.457032Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.457032Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:a1995d58d438653dbaa2d2a704ca0af868be797397bafd338d4105b9ce0358ed","observation_id":"facc6d13-c6f4-4733-8839-c90479ad228d","resolution":{"observed_at":"2026-08-05T15:10:34.457032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.421439Z","title":"Vfusion3d: Learning scalable 3d generative models from video diffusion models","venue":null,"work_id":"a7f2920b-359f-41a0-9723-b6cf91cf2a25","year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.460076Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:60d204ed828d2afdb4a299e3d1c0e30dff92e911105f36298e0732f549ee4cb7","observation_id":"3f65ac03-c715-434a-a339-3e3c1ed85d77","resolution":{"observed_at":"2026-08-05T15:10:35.425434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01430","last_updated":"2024-12-02T12:10:04Z","snapshot_observed_at":"2026-08-09T07:24:10.400011Z","submitted_at":"2024-12-02T12:10:04Z","title":"MVImgNet2.0: A Larger-scale Dataset of Multi-view Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01430","snapshot_observed_at":"2026-08-05T15:10:34.464265Z","title":"Mvimgnet2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.464265Z"},"links":{"cited_paper":"/paper/2412.01430","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:b8aeda0a5733543dddd614fb7ab28de30c4e6cebee918eb1c72da1f21f82e59b","observation_id":"fd0bcfaa-ced7-4c8a-a4bb-784139fc100b","resolution":{"observed_at":"2026-08-05T15:10:34.464265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-05T15:10:34.467803Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.467803Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:752eb933b237296ece79355c2285eff80687bfae31e88b8557db17889695f64a","observation_id":"d958bc0b-8f21-4635-a707-b99e7de1bffb","resolution":{"observed_at":"2026-08-05T15:10:34.467803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04400","last_updated":"2024-03-09T10:47:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-08T00:03:52Z","title":"LRM: Large Reconstruction Model for Single Image to 3D","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04400","snapshot_observed_at":"2026-08-05T15:10:34.470949Z","title":"Lrm: Large reconstruction model for single image to 3d","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.470949Z"},"links":{"cited_paper":"/paper/2311.04400","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:c11f963b72d95f6c8026563627e85633c70c6fafda8d0f75b1d92f7497b7d13f","observation_id":"48f5ad7a-0b13-48d9-a84c-74fe91651b8e","resolution":{"observed_at":"2026-08-05T15:10:34.470949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T15:10:34.474148Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.474148Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:c724f4215c2e888976259497d74f52c2cc6d3437bbad2b75273174810c11ac0d","observation_id":"21de0803-f76f-41a1-883c-72c15bd8c000","resolution":{"observed_at":"2026-08-05T15:10:34.474148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10507","last_updated":"2025-06-30T07:13:23Z","snapshot_observed_at":"2026-08-09T14:38:23.123656Z","submitted_at":"2025-06-12T09:09:28Z","title":"Edit360: 2D Image Edits to 3D Assets from Any Angle","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10507","snapshot_observed_at":"2026-08-05T15:10:34.477296Z","title":"Edit360: 2d image edits to 3d assets from any angle","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.477296Z"},"links":{"cited_paper":"/paper/2506.10507","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:3af4d3f3daba9b62f9430786c3495e0da522a9f6a5cd7012004078d163646d5b","observation_id":"308b1e13-b853-45d9-8cde-43f304a4edae","resolution":{"observed_at":"2026-08-05T15:10:34.477296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.411937Z","title":"Epidiff: Enhancing multi-view synthesis via localized epipolar-constrained diffusion","venue":null,"work_id":"22856174-77db-401a-971e-8254955c1761","year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.480357Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:c918ac2b05d117dd244b13ce3d3e3eada7fca616f63d4eed51102348d90d17b8","observation_id":"08b9e0f6-d422-4e49-abe8-425f98cd375d","resolution":{"observed_at":"2026-08-05T15:10:35.415474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15442","last_updated":"2025-06-18T13:14:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T13:14:46Z","title":"Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15442","snapshot_observed_at":"2026-08-05T15:10:34.483179Z","title":"Hunyuan3d 2.1: From images to high-fidelity 3d assets with production-ready pbr material","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.483179Z"},"links":{"cited_paper":"/paper/2506.15442","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:4bcc71a7d07b1f6155e3aa90915111277ea78e1a8ea2b6d0c2a8babf07e66a73","observation_id":"920d776e-ef5c-4ce2-bce1-0c264c059269","resolution":{"observed_at":"2026-08-05T15:10:34.483179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T15:10:34.486525Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.486525Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:c4a2a63cad71e0fb7b599808b5fc123b073e7267125025a6d6622a242ce279cd","observation_id":"988279af-96ff-4ed8-bd96-30bc857d3558","resolution":{"observed_at":"2026-08-05T15:10:34.486525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11398","last_updated":"2024-09-09T06:21:21Z","snapshot_observed_at":"2026-08-04T21:01:09.798457Z","submitted_at":"2024-07-16T05:35:57Z","title":"Animate3D: Animating Any 3D Model with Multi-view Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11398","snapshot_observed_at":"2026-08-05T15:10:34.489621Z","title":"Animate3d: Animating any 3d model with multi-view video diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.489621Z"},"links":{"cited_paper":"/paper/2407.11398","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:3dc0e0ffa8c1bbff6b8a1e1ccf7060790ba4bf5eb9c62a01514869c053512fdf","observation_id":"17b7d81f-4e50-41bc-83c2-e5a8a534ae52","resolution":{"observed_at":"2026-08-05T15:10:34.489621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02463","last_updated":"2023-05-03T23:59:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-03T23:59:13Z","title":"Shap-E: Generating Conditional 3D Implicit Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02463","snapshot_observed_at":"2026-08-05T15:10:34.492842Z","title":"Shap-e: Generating conditional 3d implicit functions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.492842Z"},"links":{"cited_paper":"/paper/2305.02463","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:542520d89b8ca31aeedef577425af7036643435ea5c8fece4c91387e7870242f","observation_id":"ad06960e-1424-4cd1-93aa-5ac15bedcb22","resolution":{"observed_at":"2026-08-05T15:10:34.492842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20946","last_updated":"2025-06-26T02:25:16Z","snapshot_observed_at":"2026-08-09T05:33:37.606338Z","submitted_at":"2025-06-26T02:25:16Z","title":"Consistent Zero-shot 3D Texture Synthesis Using Geometry-aware Diffusion and Temporal Video Models","version":1},"cited_work":{"arxiv_id":"2506.20946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.20946","snapshot_observed_at":"2026-08-05T15:10:34.989409Z","title":"Consistent Zero-shot 3D Texture Synthesis Using Geometry-aware Diffusion and Temporal Video Models","venue":"cs.GR","work_id":"186b75e8-f350-42dc-a34f-2aa70dc61e8c","year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.496187Z"},"links":{"cited_paper":"/paper/2506.20946","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:a25de0617f7a00711b0a68f3992f44f3afc2f9fb40bf2760a0e0b9e84e9548ad","observation_id":"695a08c6-6853-4d49-9691-7fb91f2bc1f2","resolution":{"observed_at":"2026-08-05T15:10:34.993723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.499286Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.499286Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:fdf99bc8b0ea3df951acfe547d9b4c7f70d4149ba03f1a097c580d1d5f6dd065","observation_id":"4cfde178-041e-44a6-837a-b1fd290b6443","resolution":{"observed_at":"2026-08-05T15:10:34.499286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T15:10:34.502295Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.502295Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:b277570e5bc0bcaee238cbca3cb476480c3c6cb1fa5518cc6326b385883e3f67","observation_id":"d4ac9a47-1d0b-4352-b197-5e3f16c30e7e","resolution":{"observed_at":"2026-08-05T15:10:34.502295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-07-06T21:44:22.901650Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-05T15:10:34.505566Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.505566Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:f54eb802955a678714b59715f1f9336ed805397e6abd75ef8cb8057099b39f26","observation_id":"f9a65250-3c3d-4b5f-b1e4-426cdf3a4671","resolution":{"observed_at":"2026-08-05T15:10:34.505566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16504","last_updated":"2025-06-19T17:57:40Z","snapshot_observed_at":"2026-07-06T21:44:57.091757Z","submitted_at":"2025-06-19T17:57:40Z","title":"Hunyuan3D 2.5: Towards High-Fidelity 3D Assets Generation with Ultimate Details","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16504","snapshot_observed_at":"2026-08-05T15:10:34.508756Z","title":"Hunyuan3d 2.5: Towards high-fidelity 3d assets generation with ultimate details","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.508756Z"},"links":{"cited_paper":"/paper/2506.16504","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:1121ab89eb8dda5c151608cc4a2b31b57fa0deb1f76432447fde605935ef27bd","observation_id":"386283b7-d241-47bf-846f-3626931ae5b2","resolution":{"observed_at":"2026-08-05T15:10:34.508756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.396989Z","title":"Image content generation with causal reasoning","venue":null,"work_id":"a6b14217-de9b-4652-bdbe-c7d717fce3ab","year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.512022Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:6b323a4ae632ad4696368a6e63cc9d4a4326bdb739a8b21ef3f9c2b01e646c82","observation_id":"04c95281-7e4f-4149-aeba-d220a21ac823","resolution":{"observed_at":"2026-08-05T15:10:35.400254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09981","last_updated":"2025-02-09T11:04:10Z","snapshot_observed_at":"2026-07-06T17:45:02.270647Z","submitted_at":"2024-03-15T02:57:20Z","title":"Controllable Text-to-3D Generation via Surface-Aligned Gaussian Splatting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09981","snapshot_observed_at":"2026-08-05T15:10:34.514985Z","title":"Controllable text-to-3d generation via surface-aligned gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.514985Z"},"links":{"cited_paper":"/paper/2403.09981","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:2867268386cc2959182dbe30a521466a8f4a0f055222103c56ff5d8c86aed04f","observation_id":"37e92540-c9fd-4f8c-bdcd-5b5e6de8ae4a","resolution":{"observed_at":"2026-08-05T15:10:34.514985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.518286Z","title":"Magic3d: High-resolution text-to-3d content creation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.518286Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:a93ad719bef929519cb342941522d79c84afbd9b257fdfe85c5f20ec71de2b57","observation_id":"193df7d9-d4fa-4e5b-a63f-55daa513e363","resolution":{"observed_at":"2026-08-05T15:10:34.518286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07334","last_updated":"2025-04-11T23:48:12Z","snapshot_observed_at":"2026-08-07T16:07:02.144831Z","submitted_at":"2025-04-09T23:29:08Z","title":"Objaverse++: Curated 3D Object Dataset with Quality Annotations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07334","snapshot_observed_at":"2026-08-05T15:10:34.521155Z","title":"Objaverse++: Curated 3d object dataset with quality annotations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.521155Z"},"links":{"cited_paper":"/paper/2504.07334","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:a5d8888e8202d0d6822e89a2bdbb1ffcaa48e0475914860c03ee1b5556483188","observation_id":"182183d9-301d-476e-9043-ed6357f67143","resolution":{"observed_at":"2026-08-05T15:10:34.521155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.381002Z","title":"Kiss3dgen: Repurposing image diffusion models for 3d asset generation","venue":null,"work_id":"9ee8267d-c6b8-4c63-b012-62e1c0fc3e6c","year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.524181Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:bc6c306bb7ff3ab126547287158536a7dfc9ee518186fcaf085de609ef277358","observation_id":"4b1e83dd-5bb9-4be1-a556-b26f2b2eb825","resolution":{"observed_at":"2026-08-05T15:10:35.384411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.370620Z","title":"Zero-1-to-3: Zero-shot one image to 3d object","venue":null,"work_id":"61089d18-cdba-4720-aab0-12b2b72c7abd","year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.527093Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:e8b95eedcf3ea6d1a6765749a6847ffb88cea03f15d1acb38c1219a636e4f43b","observation_id":"6d3fd8a9-021a-48bf-a016-196e2d05a961","resolution":{"observed_at":"2026-08-05T15:10:35.374770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.360164Z","title":"Uncommon objects in 3d","venue":null,"work_id":"d3d362dd-8e06-4acb-a5ff-389b23f7c666","year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.530034Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:aa124ec4942ac6bf4b4255a294080f38aac6d79e201c8ecf334f237d5ac8cf09","observation_id":"57671bae-21e7-4d06-ac69-bcadccea9287","resolution":{"observed_at":"2026-08-05T15:10:35.363331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.533584Z","title":"Orientation matters: Making 3d generative models orientation-aligned","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.533584Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:31b29850da7656e25240509cab2790561d4c18f4161d2d127f63ad978eda363f","observation_id":"06297104-cd06-42d9-bd7d-e1a06b61ab23","resolution":{"observed_at":"2026-08-05T15:10:34.533584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.350113Z","title":"Scalable 3d captioning with pretrained models","venue":null,"work_id":"e2b1ee3c-4c51-434a-b836-c13aa478c6d3","year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.537766Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:4587ebd111df7dfe5a7c5c29a225e359410847a17727ae66b7919c1750cae2cf","observation_id":"068be735-d772-42cb-9b09-7a8786d46ca6","resolution":{"observed_at":"2026-08-05T15:10:35.353318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08682","last_updated":"2024-02-13T18:59:51Z","snapshot_observed_at":"2026-07-06T17:29:39.117068Z","submitted_at":"2024-02-13T18:59:51Z","title":"IM-3D: Iterative Multiview Diffusion and Reconstruction for High-Quality 3D Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08682","snapshot_observed_at":"2026-08-05T15:10:34.540672Z","title":"Im-3d: Iterative multiview diffusion and reconstruction for high-quality 3d generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.540672Z"},"links":{"cited_paper":"/paper/2402.08682","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:565a564ff442b03f9d82b69a79183d2a84ca136e0f4936220eb5c51a261c96bc","observation_id":"4fd6106c-ab44-4a7b-b202-50eebb46bc4e","resolution":{"observed_at":"2026-08-05T15:10:34.540672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08751","last_updated":"2022-12-16T23:22:59Z","snapshot_observed_at":"2026-07-06T14:31:54.932806Z","submitted_at":"2022-12-16T23:22:59Z","title":"Point-E: A System for Generating 3D Point Clouds from Complex Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08751","snapshot_observed_at":"2026-08-05T15:10:34.544067Z","title":"Point-e: A system for generating 3d point clouds from complex prompts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.544067Z"},"links":{"cited_paper":"/paper/2212.08751","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:54f56ed74ad4c29d1e84139693e65a1cb36143b360da51fcb942793be4a09576","observation_id":"f7a635c1-9b25-4986-9264-c6ab6706f954","resolution":{"observed_at":"2026-08-05T15:10:34.544067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.548134Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.548134Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:4a44bb4190ea684c12541f36f93b5284cbeb73a4b9bd4b6452c95389a0989f29","observation_id":"68c2a97a-ea46-4811-a9be-7b9acc7eb3a7","resolution":{"observed_at":"2026-08-05T15:10:34.548134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.334053Z","title":"Openai-sora","venue":null,"work_id":"bc51703d-9b84-4f0b-b7b1-a91770ac448c","year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.551028Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:6747d9fb06186693b808e6b38534a856763fddfdec79c3cfd4156b8d8d7a3df7","observation_id":"30e97978-bb67-4159-93ea-fb86f10062cf","resolution":{"observed_at":"2026-08-05T15:10:35.337399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-05T15:10:34.554105Z","title":"Dreamfusion: Text-to-3d using 2d diffusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.554105Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:645dc8bf497f3e07da692a88d898b08fc3ef3a7a0d5dd12e1cce77502c08ec41","observation_id":"4c2527ef-cc38-4efc-ad70-ff8fbcc94799","resolution":{"observed_at":"2026-08-05T15:10:34.554105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.557396Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.557396Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:1d45066c36b2aaf5e473604b692d8f7981a8d8402b3bfc0ae516f06db72e915f","observation_id":"584d06d6-33dd-4a29-952f-11021f0e644a","resolution":{"observed_at":"2026-08-05T15:10:34.557396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.560555Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.560555Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:22c1f0e4a78e0b6d959e7883b3e0cbcd8e8f519589e035391be62440da247936","observation_id":"472030f9-055a-44b2-80a1-1fd0184db3c0","resolution":{"observed_at":"2026-08-05T15:10:34.560555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.563508Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.563508Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:c6b05ae06f19f5ae7a4f1ea6cb4add0e120461a3cd5aa3f7ec41cc7f165344e5","observation_id":"871b4c6f-c493-4906-a033-f64f1d81060d","resolution":{"observed_at":"2026-08-05T15:10:34.563508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.307133Z","title":"Common objects in 3d: Large-scale learning and evaluation of real-life 3d category reconstruction","venue":null,"work_id":"cccaff02-8d7d-4ab9-a821-5e123f72b2f2","year":2021},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.566498Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:dbe8936988bea070eb598a58ee4680f18ed54a7d5770816bc1509bf68415eeb3","observation_id":"70c8a25c-28ef-4056-8ef8-35b278d2d0ee","resolution":{"observed_at":"2026-08-05T15:10:35.310568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.570120Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.570120Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:b30274774cf3be583ecac8118c2d01a32d5a2300ba5e081a1ea550b8bc277ad9","observation_id":"3f609a49-d823-455e-afb3-2716c9b87070","resolution":{"observed_at":"2026-08-05T15:10:34.570120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.573050Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.573050Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:3c7673a07b17903966aaf5563a8d5611b16720cd8099f3e1eb64fa502249d3dc","observation_id":"351da0f7-503f-485e-8c73-6e984f5f1a3f","resolution":{"observed_at":"2026-08-05T15:10:34.573050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T15:10:34.575950Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.575950Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:081abdad1b7860b45856fbefc41db3a41281ba4ecb36f2043738910c9913d8f8","observation_id":"7a96b04b-eb18-431a-a158-6f5ffbf3a8e9","resolution":{"observed_at":"2026-08-05T15:10:34.575950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T15:10:34.579065Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.579065Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:7df76f14535f6fffe4929b0f8d5a31b1f1c4ddcf04ab4541963af4305d4dc27d","observation_id":"64f4bad2-df1b-4476-9751-a4f2260e6bc2","resolution":{"observed_at":"2026-08-05T15:10:34.579065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15110","last_updated":"2023-10-23T17:18:59Z","snapshot_observed_at":"2026-07-06T16:37:19.963994Z","submitted_at":"2023-10-23T17:18:59Z","title":"Zero123++: a Single Image to Consistent Multi-view Diffusion Base Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15110","snapshot_observed_at":"2026-08-05T15:10:34.582125Z","title":"Zero123++: a single image to consistent multi-view diffusion base model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.582125Z"},"links":{"cited_paper":"/paper/2310.15110","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:a074cc9e251def7d753c86685b5629565ab2cd76670f30b2bb6d7286d58675fb","observation_id":"b7d59c6b-e639-44f8-b18b-750f6f83a37f","resolution":{"observed_at":"2026-08-05T15:10:34.582125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16512","last_updated":"2024-04-18T04:12:32Z","snapshot_observed_at":"2026-07-06T16:12:38.269310Z","submitted_at":"2023-08-31T07:49:06Z","title":"MVDream: Multi-view Diffusion for 3D Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16512","snapshot_observed_at":"2026-08-05T15:10:34.585377Z","title":"Mvdream: Multi- view diffusion for 3d generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.585377Z"},"links":{"cited_paper":"/paper/2308.16512","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:215b81290f658a7ac48c6ada37b872e5795d8078d8fa186c317e950e46918564","observation_id":"ee4f77f1-eedc-47eb-b304-ce37991a084d","resolution":{"observed_at":"2026-08-05T15:10:34.585377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.285232Z","title":"Lgm: Large multi-view gaussian model for high-resolution 3d content creation","venue":null,"work_id":"8f591f5b-ff07-40bd-b16d-803351c57220","year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.588600Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:a2b7a5649112567e3780f7130570e0ca1351a3bb1e79ae4879a2f2c8489d72d6","observation_id":"f9652382-de4c-49bb-bc02-485c0500120e","resolution":{"observed_at":"2026-08-05T15:10:35.288855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.275414Z","title":"Make-it-3d: High-fidelity 3d creation from a single image with diffusion prior","venue":null,"work_id":"16e2cd8a-02ae-4bef-8dae-a6677cb8add0","year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.592179Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:874b1e9df355bbdbac61368e5dba22d125abaca17214638f847c6e982268e97f","observation_id":"41ea7506-0a8d-4a72-8eaa-8d8d530f60d0","resolution":{"observed_at":"2026-08-05T15:10:35.278939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.265099Z","title":"Sv3d: Novel multi-view synthesis and 3d generation from a single image using latent video diffusion","venue":null,"work_id":"3d616374-745b-4d01-8f94-23f616e3ee3b","year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.595343Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:f29efc17987899e6c27f8280cad86307f42a69e373dab67e51fbcce5659edbaa","observation_id":"b72c936c-abca-49f0-a910-a9fd905b1e37","resolution":{"observed_at":"2026-08-05T15:10:35.269035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.254975Z","title":"Nova-3d: Non-overlapped views for 3d anime character reconstruction","venue":null,"work_id":"86b40651-fbae-4123-8138-047ab3310fa9","year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.598543Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:47943982ee49600df9b8bf0d710de6973bdb4dc7fd3e8e8c9ed181677c7b3737","observation_id":"093cb559-b945-42fc-b056-fa5b197f6301","resolution":{"observed_at":"2026-08-05T15:10:35.258446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.601674Z","title":"Pro- lificdreamer: High-fidelity and diverse text-to-3d generation with variational score distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.601674Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:b99a8b62acc72c49619dedcba19ca3c2a37307d29d1ac0473bbe791e18516ab7","observation_id":"6959c736-ee2a-4365-8e89-c65c617e1f14","resolution":{"observed_at":"2026-08-05T15:10:34.601674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.239684Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"d8a77da7-4c6b-44be-a285-7812543536ad","year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.604647Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:04c8f6a0ab65f58f4396c4c2d2314356c272525b44fb4d7a7a7013902bc8ff2a","observation_id":"64471e07-d3fa-4c1a-b259-a5e039e1784a","resolution":{"observed_at":"2026-08-05T15:10:35.243200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.229721Z","title":"Genfusion: Closing the loop between reconstruction and generation via videos","venue":null,"work_id":"3b383e74-baad-426f-9c11-a2ed0d528a66","year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.607633Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:7896c42694b338eacaf900f0bf582587f4d6f979faa785badeeb7a2d37b3a88b","observation_id":"ef461b07-f65d-4802-8c3e-5446b6d96f1c","resolution":{"observed_at":"2026-08-05T15:10:35.233771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.219598Z","title":"Omniobject3d: Large-vocabulary 3d object dataset for realistic perception, reconstruction and generation","venue":null,"work_id":"61ff2e5b-e922-4a72-bf70-277910716ad5","year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.610625Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:1b3a9227a0a02e79811f0a32d4a3be1931c78964f135222571bb44ec5f3b8dc1","observation_id":"26693e0f-d6b0-4c3d-bc0c-6d5cee6d95c3","resolution":{"observed_at":"2026-08-05T15:10:35.223600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:34.613644Z","title":"Structured 3d latents for scalable and versatile 3d generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.613644Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:4eb1e740e99f8ada4bed90c5ec64209db2a891e31c52b51060dba10c35c1bb7e","observation_id":"455b0228-c763-4f03-8f8a-606d31342023","resolution":{"observed_at":"2026-08-05T15:10:34.613644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07191","last_updated":"2024-04-14T16:54:24Z","snapshot_observed_at":"2026-07-06T17:58:25.894552Z","submitted_at":"2024-04-10T17:48:37Z","title":"InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07191","snapshot_observed_at":"2026-08-05T15:10:34.616483Z","title":"In- stantmesh: Efficient 3d mesh generation from a single image with sparse-view large reconstruc- tion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.616483Z"},"links":{"cited_paper":"/paper/2404.07191","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:c9ef3d7331edd075af2daa2eef37395aa1953f5583ef04982ab5be4c1f96dc91","observation_id":"b792d6e1-8609-47a8-9a36-971bb6d5872d","resolution":{"observed_at":"2026-08-05T15:10:34.616483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10745","last_updated":"2024-10-14T17:23:13Z","snapshot_observed_at":"2026-07-06T19:33:12.610676Z","submitted_at":"2024-10-14T17:23:13Z","title":"FlexGen: Flexible Multi-View Generation from Text and Image Inputs","version":1},"cited_work":{"arxiv_id":"2410.10745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10745","snapshot_observed_at":"2026-08-05T15:10:34.763699Z","title":"FlexGen: Flexible Multi-View Generation from Text and Image Inputs","venue":"cs.CV","work_id":"8a8d5bf0-3877-4a3c-81b7-70ea6e9736ce","year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.619929Z"},"links":{"cited_paper":"/paper/2410.10745","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:87921c63fe0e0a7bda4c4abebe7f8444744d93ab4512bb83b01293e010f909fc","observation_id":"785e4a25-fc60-4d4b-8cc4-21b1e0221b68","resolution":{"observed_at":"2026-08-05T15:10:34.767528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09217","last_updated":"2023-11-15T18:58:41Z","snapshot_observed_at":"2026-08-05T20:14:58.727218Z","submitted_at":"2023-11-15T18:58:41Z","title":"DMV3D: Denoising Multi-View Diffusion using 3D Large Reconstruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09217","snapshot_observed_at":"2026-08-05T15:10:34.623059Z","title":"Dmv3d: Denoising multi-view diffusion using 3d large reconstruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.623059Z"},"links":{"cited_paper":"/paper/2311.09217","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:11299db710b564a8bcbeb3a46bc1ea7be38c2cba84c3de265f2d98d62908f17b","observation_id":"4f1081ed-3803-4694-8780-5070289dcb38","resolution":{"observed_at":"2026-08-05T15:10:34.623059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.204065Z","title":"Hi3d: Pursuing high-resolution image-to-3d generation with video diffusion models","venue":null,"work_id":"e800ee7a-37a3-4861-9197-048ac8a3bb8c","year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.626409Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:b927fcf3df8e9f3db0fa5df98085f406fa1c2df87a18a3d097e47e54b4987dc5","observation_id":"e8dea98a-648f-4610-88d4-843f0babb429","resolution":{"observed_at":"2026-08-05T15:10:35.207733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.193755Z","title":"Tv-3dg: Mastering text-to-3d customized generation with visual prompt","venue":null,"work_id":"66a0ddda-ef14-4eb6-b899-e4c04ba999c3","year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.629383Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:581c0c76611122d7a23e6ac16136c7fd75e5fe79d725357e6e56f0a9afdc0403","observation_id":"81c6d741-5c9d-4bb7-bb68-6749f00d3e1a","resolution":{"observed_at":"2026-08-05T15:10:35.197341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T15:10:34.633085Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.633085Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:14b1e2326da4a52efe9781aebcc5aeb8a76f879990fe005430b7b887731b8d5f","observation_id":"aa02705c-da16-400b-a985-9d492efe3d51","resolution":{"observed_at":"2026-08-05T15:10:34.633085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.183386Z","title":"Gaussiandreamer: Fast generation from text to 3d gaussians by bridging 2d and 3d diffusion models","venue":null,"work_id":"050a83a8-d220-48b3-a3c8-0a43b765d49f","year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.636465Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:8e7280c1db06a5aa2918dee1fd476e0bfd3d93ada6aeeddc7edf3eaf5e084d6e","observation_id":"3a210bbb-1e9b-4f63-97d0-625b52f6cb0c","resolution":{"observed_at":"2026-08-05T15:10:35.186912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18462","last_updated":"2024-06-26T16:12:09Z","snapshot_observed_at":"2026-07-06T18:37:26.588451Z","submitted_at":"2024-06-26T16:12:09Z","title":"GaussianDreamerPro: Text to Manipulable 3D Gaussians with Highly Enhanced Quality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18462","snapshot_observed_at":"2026-08-05T15:10:34.639509Z","title":"Gaussiandreamerpro: Text to manipulable 3d gaussians with highly enhanced quality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.639509Z"},"links":{"cited_paper":"/paper/2406.18462","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:ce14e88ebc8ac804bedead75df3dad6ce503055d5e9eb34f2e38e0ce889828df","observation_id":"586b033e-6dc0-4acf-9023-138fc11c1652","resolution":{"observed_at":"2026-08-05T15:10:34.639509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.173712Z","title":"Mvimgnet: A large-scale dataset of multi-view images","venue":null,"work_id":"8853634a-163e-457c-8801-2187a5c8abc4","year":2023},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.642641Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:dda9f9258e12f484644eb5ecc530e946b6beb3af2f5206c207da14a1c6113f64","observation_id":"4c9b92d3-4e7b-43cc-87e8-b059b70070ac","resolution":{"observed_at":"2026-08-05T15:10:35.177050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06053","last_updated":"2025-03-08T04:37:38Z","snapshot_observed_at":"2026-08-07T17:20:44.613205Z","submitted_at":"2025-03-08T04:37:38Z","title":"DropletVideo: A Dataset and Approach to Explore Integral Spatio-Temporal Consistent Video Generation","version":1},"cited_work":{"arxiv_id":"2503.06053","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06053","snapshot_observed_at":"2026-08-05T15:10:34.722783Z","title":"DropletVideo: A Dataset and Approach to Explore Integral Spatio-Temporal Consistent Video Generation","venue":"cs.CV","work_id":"760bf67b-2b65-47f7-a9be-ca6a74d11147","year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.646626Z"},"links":{"cited_paper":"/paper/2503.06053","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:d9b9e7c710515ceb721a2888329d728f471c5861111833beb4f6cf3c72636477","observation_id":"b4b69543-bd70-499e-abfc-27f0ed1cc7ce","resolution":{"observed_at":"2026-08-05T15:10:34.728196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10868","last_updated":"2025-09-03T18:01:47Z","snapshot_observed_at":"2026-08-08T03:05:33.705182Z","submitted_at":"2025-08-14T17:43:25Z","title":"TexVerse: A Universe of 3D Objects with High-Resolution Textures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10868","snapshot_observed_at":"2026-08-05T15:10:34.650803Z","title":"Texverse: A universe of 3d objects with high-resolution textures","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.650803Z"},"links":{"cited_paper":"/paper/2508.10868","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:1a62a5d909582b1d49b36aa5fcc40da4a0b9dbbafbfa939a8030fb3f56f3b6b8","observation_id":"5fb8b89d-8eb5-499e-b2e5-71b6ca52e8ca","resolution":{"observed_at":"2026-08-05T15:10:34.650803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.164075Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":"19d055f6-87fb-469c-b408-9744813d59d7","year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.654217Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:1c1f4c02f7eb838e2cbb8e4911d6e2ae94e6312eb9b8ad23e3a0e89d564d81a4","observation_id":"954546e9-d23e-49df-9040-aef1526cf96f","resolution":{"observed_at":"2026-08-05T15:10:35.167469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12202","last_updated":"2026-05-14T15:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-21T15:16:54Z","title":"Hunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12202","snapshot_observed_at":"2026-08-05T15:10:34.657279Z","title":"Hunyuan3d 2.0: Scaling diffusion models for high resolution textured 3d assets generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.657279Z"},"links":{"cited_paper":"/paper/2501.12202","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:be5f0dc03ff73fa0bd049177d26b59a38af982ab9fbc450877a24578842faad9","observation_id":"d36a4827-8162-4144-b540-e1231c7ca298","resolution":{"observed_at":"2026-08-05T15:10:34.657279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.04797","last_updated":"2016-07-02T03:15:10Z","snapshot_observed_at":"2026-07-06T04:56:26.545306Z","submitted_at":"2016-05-16T15:09:19Z","title":"Thingi10K: A Dataset of 10,000 3D-Printing Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.04797","snapshot_observed_at":"2026-08-05T15:10:34.660555Z","title":"Thingi10k: A dataset of 10,000 3d-printing models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.660555Z"},"links":{"cited_paper":"/paper/1605.04797","citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:93d3be3fb072629100cced8ea7e91a3cbd81e7ce2268f7f37a8f3f9ea5bf945b","observation_id":"43889be4-aa2e-41fb-a759-57cf84690865","resolution":{"observed_at":"2026-08-05T15:10:34.660555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.154247Z","title":"High-fidelity 3d textured shapes generation by sparse encoding and adversarial decoding","venue":null,"work_id":"82d595bf-2039-4bae-a4c9-147a855386b5","year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.663959Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:e58118cb6bb9168c039a7ac8928c07f1b29a1e7e6905d7638115d875023ddcd4","observation_id":"1038a5d0-fd50-4711-811b-14545ba6f2b2","resolution":{"observed_at":"2026-08-05T15:10:35.157582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:10:35.144437Z","title":"Videomv: Consistent multi-view generation based on large video generative model","venue":null,"work_id":"6098ee70-dac1-4e88-afd2-5168b4a09e64","year":2024},"citing_paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:34.667840Z"},"links":{"citing_paper":"/paper/2508.20470"},"observation_digest":"sha256:b5fb1113c1baf8e3c021a02bc1355d36dd71d1edab58be1f3236cf488e47ebd1","observation_id":"c0da1c71-e5f0-444e-aac7-d6b1a7c0ecb6","resolution":{"observed_at":"2026-08-05T15:10:35.147888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20470","last_updated":"2025-08-28T06:39:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T11:17:09.873595Z","submitted_at":"2025-08-28T06:39:41Z","title":"Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":3,"verified_fuzzy":27},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 2 inbound Pith citation observations for arXiv:2508.20470."}