{"as_of":"2026-08-15T12:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b99af94d9d779a9c252dd6296d1fc8485b480203acdf0235cbac6712f2efe756","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T01:02:56.130644Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:44:32.969001Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T21:44:33.449281Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"cited_work":{"arxiv_id":"2412.19104","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19104","snapshot_observed_at":"2026-08-10T21:44:33.449281Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","venue":"cs.CV","work_id":"cd40a658-770d-48aa-a3e6-fbdf60cd354b","year":2024},"citing_paper":{"arxiv_id":"2501.04293","last_updated":"2025-03-28T05:13:50Z","snapshot_observed_at":"2026-08-15T01:51:20.054743Z","submitted_at":"2025-01-08T05:35:07Z","title":"TADFormer : Task-Adaptive Dynamic Transformer for Efficient Multi-Task Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:44:32.969001Z"},"links":{"cited_paper":"/paper/2412.19104","citing_paper":"/paper/2501.04293"},"observation_digest":"sha256:ac1301abc76d432174ef5b2a90abd054bbaea39a5597d06b481fc19485376190","observation_id":"b261d85d-9469-407c-83b5-0640b749b916","resolution":{"observed_at":"2026-08-10T21:44:33.453634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.19104/citation-record","integrity":"/paper/2412.19104/integrity","json":"/paper/2412.19104/citation-record.json","paper":"/paper/2412.19104"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.652335Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":"8a523f31-0577-45ab-8997-696a74409659","year":2021},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:55.954431Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:233e3dfa63129c88d14e400edbbf82c1c11372ed41d22f8850273b43a5f077df","observation_id":"16711921-5997-4531-a563-f35eaefae475","resolution":{"observed_at":"2026-08-11T01:02:56.657516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:55.959353Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:55.959353Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:5ce37ee58033fa7e5c47c8ea4cab51200340f286511b2b11dae099e0bb957828","observation_id":"5087204a-062a-409a-b718-f7f3958eb2a1","resolution":{"observed_at":"2026-08-11T01:02:55.959353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.631539Z","title":"Pre-trained image processing transformer","venue":null,"work_id":"8f6e0d9f-52df-4509-8d2e-4e94aaae7dea","year":2021},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:55.963595Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:3a073a56b6b1261fce109c2342455dab95cf6eba4dbabeac686afb8c9157d3c6","observation_id":"32281388-d623-4ce1-a379-50e416210459","resolution":{"observed_at":"2026-08-11T01:02:56.636932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.618141Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"7b32b229-c67d-4d8f-bb13-492aa41af12d","year":2020},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:55.968274Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:21b4b176bb64a30218dfa3e045d8b9de14bc5578fb976f35bf855a07238e35ee","observation_id":"2701d573-baa7-4bc1-bdf2-a5e256a7d246","resolution":{"observed_at":"2026-08-11T01:02:56.622645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.607173Z","title":"Context autoencoder for self- supervised representation learning","venue":null,"work_id":"c4bd240e-c47f-4700-896d-bbb5fb06ca3f","year":2024},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:55.972787Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:12bbc23d99cf484131017218a979c5610840cf8eb0c78dc554d355a33ec1a03e","observation_id":"1396c092-74d4-48ce-aff1-55db76de6ef9","resolution":{"observed_at":"2026-08-11T01:02:56.610732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14404","last_updated":"2024-01-25T18:59:57Z","snapshot_observed_at":"2026-08-15T09:01:41.810776Z","submitted_at":"2024-01-25T18:59:57Z","title":"Deconstructing Denoising Diffusion Models for Self-Supervised Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14404","snapshot_observed_at":"2026-08-11T01:02:55.977251Z","title":"De- constructing denoising diffusion models for self-supervised learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:55.977251Z"},"links":{"cited_paper":"/paper/2401.14404","citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:10f30ab80aeac4c41b26329e2aa9f73f68971bbde718382b4b722699ed7ca070","observation_id":"d7d51be8-6c58-424d-809a-3ea35b81b605","resolution":{"observed_at":"2026-08-11T01:02:55.977251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08330","last_updated":"2024-04-12T08:46:53Z","snapshot_observed_at":"2026-08-15T02:40:32.196612Z","submitted_at":"2024-04-12T08:46:53Z","title":"Emerging Property of Masked Token for Effective Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08330","snapshot_observed_at":"2026-08-11T01:02:55.982018Z","title":"Emerging property of masked token for effective pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:55.982018Z"},"links":{"cited_paper":"/paper/2404.08330","citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:fabf8bbbfdce75fdb81b697eb6b398671c41e866ac72bb6804b46b26ed28c82c","observation_id":"b5cd8573-1a21-4279-8acb-f726d32b164e","resolution":{"observed_at":"2026-08-11T01:02:55.982018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:55.986055Z","title":"Salience-based adaptive masking: revisit- ing token dynamics for enhanced pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:55.986055Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:b409ffe64f53225a1d86081c69c509bfd9fbac65644be19f7af6d37531def6da","observation_id":"61993712-0102-4c2a-a66e-f00572367c43","resolution":{"observed_at":"2026-08-11T01:02:55.986055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.588382Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"bc125d14-1609-485a-9af9-d1bbbeec96ba","year":2009},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:55.990047Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:42826e2d1b311bc3ab74aaac989f37b6ac69bc12cae128824ddb98ea492addbb","observation_id":"98186132-9faa-425b-9ccc-300f3065584a","resolution":{"observed_at":"2026-08-11T01:02:56.592510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.576184Z","title":"Bootstrapped masked autoencoders for vision bert pretraining","venue":null,"work_id":"e361a191-d087-48f5-b573-1590e100a3e1","year":2022},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:55.993721Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:e1850af5b1c951012a0e8760b572b8d82f5bbb4521fa9994524f3bc29ba29737","observation_id":"c85341db-e4bf-430b-9759-e2d35b77f496","resolution":{"observed_at":"2026-08-11T01:02:56.580387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T01:02:55.997475Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:55.997475Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:925d4bc183e3b6d30265a1a9efc134c1efbbe1ccbf4d37be16a015d0875969d4","observation_id":"c4df558c-a581-40cd-b195-a7ad2a4ebc4c","resolution":{"observed_at":"2026-08-11T01:02:55.997475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.001518Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.001518Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:24f5c0cc8f334ad5aeff695dd67d841652d5d8bd7dcb44561a05a6337e17d31b","observation_id":"2bd72a33-0b08-491e-8170-f5dd86aa2b06","resolution":{"observed_at":"2026-08-11T01:02:56.001518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.551060Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":"9691093d-b8c2-4392-8ffe-ff824c4588ee","year":2020},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.005316Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:e0803c4932254026d615834cdb7be04e395accdeeea3350afdc46e2b2a8b8c97","observation_id":"bc3a8e35-3d52-4ab4-9de4-f16633a7ee7b","resolution":{"observed_at":"2026-08-11T01:02:56.555082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.538476Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"3b6ca128-75ca-44b5-b333-13e47ff086ad","year":2022},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.008566Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:7f4e602f23c5fd4ff8941783850801e661c02448af91ed6627820c4e00282721","observation_id":"86a9b906-3589-472f-8b84-a44b2e2780b5","resolution":{"observed_at":"2026-08-11T01:02:56.542971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.526021Z","title":"Unsupervised keypoints from pretrained diffusion models","venue":null,"work_id":"f7e37d37-29b5-488d-8b70-f5ae7d7074ce","year":2024},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.011935Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:03be46bd72b29b7fe40b3c9cd5c96e9f524fe767182425899092a5dc3a5648da","observation_id":"4c025cd7-2c8b-41aa-ae69-cc942aacf501","resolution":{"observed_at":"2026-08-11T01:02:56.530117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.511494Z","title":"Unsupervised semantic correspondence using stable diffu- sion","venue":null,"work_id":"94a9aad0-7c58-443c-b70f-cd675ed0cd20","year":2024},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.015246Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:8d976fbce1d20e285900b807125e4f9bce211add199d39caf4d68eb0500d7092","observation_id":"b592c68a-e5d3-41c6-bbc6-8c102808af91","resolution":{"observed_at":"2026-08-11T01:02:56.515903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.018534Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.018534Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:0c03f0f4691a15960d388d9feff7826bac06ab7f51ef9003eb9e530d85eb92b5","observation_id":"291338fb-aadd-448b-a116-f7d26e922394","resolution":{"observed_at":"2026-08-11T01:02:56.018534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19324","last_updated":"2025-03-22T19:42:20Z","snapshot_observed_at":"2026-08-12T22:15:22.006986Z","submitted_at":"2024-10-25T06:20:06Z","title":"Simpler Diffusion (SiD2): 1.5 FID on ImageNet512 with pixel-space diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19324","snapshot_observed_at":"2026-08-11T01:02:56.021927Z","title":"Simpler diffusion (sid2): 1.5 fid on imagenet512 with pixel-space diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.021927Z"},"links":{"cited_paper":"/paper/2410.19324","citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:9677d772609a84940b2e046628d8a8095849848803526b8ecc032bff9e297c54","observation_id":"b658b922-b7e5-443e-9cf8-226ffe8eb353","resolution":{"observed_at":"2026-08-11T01:02:56.021927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.026556Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.026556Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:497ebfd5240af79e16b886ac3892d75dc4185ff0a56d8f21ff734f85027582eb","observation_id":"23cb11a5-a493-41a2-a8c4-70b7c6d91670","resolution":{"observed_at":"2026-08-11T01:02:56.026556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.482172Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":"43d75ebe-7326-4cd4-a081-2cc67f7bfa41","year":2013},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.030867Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:6006a6a6c47c4c28a9e5dcc6c087734a2d3a82bbb6b05795804d5fc218e569a6","observation_id":"be2c7a95-e086-42a5-b3d6-133558da4569","resolution":{"observed_at":"2026-08-11T01:02:56.486692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.465476Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"85c4825a-c934-4917-9b06-4428ab68b2a8","year":2014},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.035619Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:ec8f81176c8556e78b4ca935adf1210b0a2af131cbf22e623f96338dd11282b5","observation_id":"ae5d13f3-306d-4e1d-a894-85f8d185d5df","resolution":{"observed_at":"2026-08-11T01:02:56.471380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-11T01:02:56.039956Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.039956Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:ecf99fea7a5b2e3cd6f4defc56243f76b1f118e4bac8f59d315b1bbb20090543","observation_id":"94fbd934-087b-4a80-bf16-4acef01956f1","resolution":{"observed_at":"2026-08-11T01:02:56.039956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.043992Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.043992Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:9cbd491353f8e86fa04f2d1622c0b214d6ce62183c5825c37090b4358481a79a","observation_id":"f1a503a7-af4d-4f3f-9d0a-1a8998f08085","resolution":{"observed_at":"2026-08-11T01:02:56.043992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.047752Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.047752Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:819253da0c13f9ad1b9b567e35e44be4914a4b16c92e39d9d1d70d07d2b4621d","observation_id":"5c7668bf-1b5c-4d68-a530-4310e4b1c7c0","resolution":{"observed_at":"2026-08-11T01:02:56.047752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.051861Z","title":"Diffusion hyperfeatures: Searching through time and space for semantic correspondence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.051861Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:0e7d2d45f9c7647a9745053359bb11caeb56b4724cf8dd26b7114247bdac5aae","observation_id":"7f8750ac-287b-4b24-b12c-c32d67ae9c1f","resolution":{"observed_at":"2026-08-11T01:02:56.051861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-08-12T17:35:23.022229Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-11T01:02:56.056244Z","title":"Fine-grained visual classi- fication of aircraft","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.056244Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:6deaa27053facdeb6674a3785956dab2a9eafb96d68ad21cf333b8239526edb8","observation_id":"f9eacf2f-b69f-4cc6-9322-ce74d2f1a1b5","resolution":{"observed_at":"2026-08-11T01:02:56.056244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.060588Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.060588Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:3bd528eadf79ec075e3dda0b8adc56ea009953372510e25e676a3e4548b9df45","observation_id":"612eb5ba-aade-47ff-9f1a-7232b6554df0","resolution":{"observed_at":"2026-08-11T01:02:56.060588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.064746Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.064746Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:6471aca33930c53e5aa203f82fafa021344c61b8a5c81c08c27893227d7db138","observation_id":"18bec5c4-2ecb-458b-8f3f-36eb1d70a5ad","resolution":{"observed_at":"2026-08-11T01:02:56.064746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.396229Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"0dbafdf3-4112-4a50-9399-3ddb901be635","year":2021},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.068865Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:69ed0abe8030148cc3695367c67e894c378fcc646d98581d65c27f578f9b044f","observation_id":"3ec8e3e9-8654-46e0-9131-a11da3de7bde","resolution":{"observed_at":"2026-08-11T01:02:56.401192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.380499Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":"dc755438-b21e-4050-a572-d3dec1082ed9","year":2021},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.072689Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:676c2958f01b9cb43cc4d5c7e67201974180c0ce2ee45f6b7f5ac424bef7397e","observation_id":"d0e1d641-e3ae-421f-935a-9f0e56efedbd","resolution":{"observed_at":"2026-08-11T01:02:56.385852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.076514Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.076514Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:c3d92e964c467bbe457b3035595026aeee2191f02a432d9abd5ed547adaaa099","observation_id":"dba26b97-fd97-4ae6-8257-6e7627cd1a2a","resolution":{"observed_at":"2026-08-11T01:02:56.076514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.080252Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.080252Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:54e091eb9df9f1f3aa6e062e3b887a96f06091f75f908e0b6f98e0e776454ea6","observation_id":"51f75e41-5357-4a8c-8600-e8ecf3d88f91","resolution":{"observed_at":"2026-08-11T01:02:56.080252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-11T01:02:56.083835Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.083835Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:9fd8e6be3dde65b03f0bd176e67b0e47d1c2f1440311eb9c3f39e0a1992f60a2","observation_id":"57f56fab-e262-40a6-bff8-b6a7f45af10d","resolution":{"observed_at":"2026-08-11T01:02:56.083835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T01:02:56.087361Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.087361Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:bc659479a0bee351738d81bf053b2c70e578d2b80aa298d0f6852d188bc36ea0","observation_id":"36742fdd-214e-455c-a1d9-bb9a22c92ee1","resolution":{"observed_at":"2026-08-11T01:02:56.087361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.090773Z","title":"Building a bird recognition app and large scale dataset with citizen scientists: The fine print in fine-grained dataset collection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.090773Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:89bb5cd94083f567e71ffbab462464bf12fe4d26dcd08a835595536384ed46e7","observation_id":"91c850b1-cf7c-44a6-a098-f159ba2dc59a","resolution":{"observed_at":"2026-08-11T01:02:56.090773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06642","last_updated":"2018-04-10T20:22:13Z","snapshot_observed_at":"2026-08-14T20:46:18.748174Z","submitted_at":"2017-07-20T17:59:55Z","title":"The iNaturalist Species Classification and Detection Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06642","snapshot_observed_at":"2026-08-11T01:02:56.094114Z","title":"The inaturalist challenge 2017 dataset.arXiv preprint arXiv:1707.06642, 1(2):4, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.094114Z"},"links":{"cited_paper":"/paper/1707.06642","citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:d53853dcb8bd0bd63d8837ca4f15c9fa3a4b43038e53b2bcd4f39a8a3bcc6fba","observation_id":"268ff3d6-50e0-463a-9f0b-b1a741311cdd","resolution":{"observed_at":"2026-08-11T01:02:56.094114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.097953Z","title":"The inaturalist species classification and de- tection dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.097953Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:8cba2c47d91f2a5d7f694563a7be5cf5c0fc981f31fbcc0f2029e8adfd71ebe3","observation_id":"68825b24-dc32-460c-a38f-6accbec73dfa","resolution":{"observed_at":"2026-08-11T01:02:56.097953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.337000Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":"7c8a4f31-15d5-4f3f-a702-8e608abac554","year":2011},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.102152Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:afc7675eec7a6b1a17c2b97c59c5e4a38a847b403a30d10524c7740bb137c2ba","observation_id":"f51c4bde-3480-4fdb-a04a-1c68904bdb9b","resolution":{"observed_at":"2026-08-11T01:02:56.341954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.323360Z","title":"Diffusion models as masked autoencoders","venue":null,"work_id":"9b666d0b-fda0-4aa1-969a-b2678117dc65","year":2023},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.105987Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:782ed25bd513c6696c9bec7f210f87e4b2f571504ebfe81b8c9d76ca7347438d","observation_id":"f0e5fe92-855a-4733-980d-f7e7da21bf5c","resolution":{"observed_at":"2026-08-11T01:02:56.327716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.308464Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":"5c91c8f2-433c-4bde-b7be-92499e34710c","year":2022},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.109871Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:067dda9f871dace15f8239e7a14834411404621dfc11be7df309e4ea7063b958","observation_id":"381dce87-cf43-4677-8762-d4e2ab1c558a","resolution":{"observed_at":"2026-08-11T01:02:56.314775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09616","last_updated":"2023-01-29T06:15:39Z","snapshot_observed_at":"2026-08-13T15:40:42.113113Z","submitted_at":"2022-05-19T15:22:29Z","title":"Masked Image Modeling with Denoising Contrast","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09616","snapshot_observed_at":"2026-08-11T01:02:56.113714Z","title":"Masked image modeling with denoising contrast","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.113714Z"},"links":{"cited_paper":"/paper/2205.09616","citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:ea0bc2b190c5bfa5a64683a81d949363c19b5e9be41e4c81c9dd2b76fef9a55d","observation_id":"b41bdae4-4d42-4748-97e6-a984aa472455","resolution":{"observed_at":"2026-08-11T01:02:56.113714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09305","last_updated":"2024-03-05T01:10:18Z","snapshot_observed_at":"2026-08-14T19:55:50.519855Z","submitted_at":"2023-06-15T17:38:48Z","title":"Fast Training of Diffusion Models with Masked Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09305","snapshot_observed_at":"2026-08-11T01:02:56.117688Z","title":"Fast training of diffusion models with masked transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.117688Z"},"links":{"cited_paper":"/paper/2306.09305","citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:72bb30e0628f86a2760d786b601aad482ba603cc8d573a4721ab6c454048c5f5","observation_id":"79d7d66e-c587-4e38-8cd1-03f8cdf3894c","resolution":{"observed_at":"2026-08-11T01:02:56.117688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.122105Z","title":"Rethinking semantic segmen- tation from a sequence-to-sequence perspective with trans- formers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.122105Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:0574c722943e46655295dbaa1d9b040f0a414e7925f5b9355ca02e92acf6bc9f","observation_id":"5ae084a7-dc13-400f-b74c-87767a6ab6d4","resolution":{"observed_at":"2026-08-11T01:02:56.122105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T01:02:56.126490Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.126490Z"},"links":{"citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:21fbcec570fbbeef33872cd3ed30ca4483e0a9345b791e27184e8041b1019c88","observation_id":"dd94211a-ca3e-4b40-9297-b6e0e4920042","resolution":{"observed_at":"2026-08-11T01:02:56.126490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-11T01:02:56.130644Z","title":"Deformable detr: Deformable trans- formers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T01:02:56.130644Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2412.19104"},"observation_digest":"sha256:4385b41d46d4b04f45263626a28c33f3f13d2ab5c2e97975b5c13b3e55acc18c","observation_id":"1232b076-f48f-4cc3-a6b9-2e678fbfb910","resolution":{"observed_at":"2026-08-11T01:02:56.130644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.19104","last_updated":"2024-12-26T07:47:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T03:51:21.211579Z","submitted_at":"2024-12-26T07:47:20Z","title":"Improving Generative Pre-Training: An In-depth Study of Masked Image Modeling and Denoising Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2412.19104."}