{"as_of":"2026-08-07T17:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:355cf5099d69aeef1f21925938d80c451832b8a382999729dadae9f6197f6c7f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:55:04.112273Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T08:42:45.265620Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T08:38:27.946746Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2412.00131"},"observation_digest":"sha256:290bfe5b8a4d70a3fd66e08ebb56772c4bec456dbd3715c3f80d0e0ca1c6377c","observation_id":"73009a21-2caf-4f69-81db-9eb190b1b2c6","resolution":{"observed_at":"2026-05-23T08:42:45.269086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T12:01:51.366667Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2412.20404"},"observation_digest":"sha256:ac86030024ceecb5e854545c61d25e1eb5235a21012240ae5acd6f0b67c12d26","observation_id":"4909bd1a-5938-4876-9623-636287ab0945","resolution":{"observed_at":"2026-05-11T12:01:51.723341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T10:36:12.058970Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2501.00103"},"observation_digest":"sha256:f4fbcfb226b516303e84251c4616231038f0b41c8f11b716ef531d061b7ec518","observation_id":"a3c774d1-25f2-4fd5-9be4-3abfc338d138","resolution":{"observed_at":"2026-05-11T10:36:12.409398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-07T14:55:04.112273Z","title":"Fit: Flexible vision transformer for diffusion model.arXiv preprint arXiv:2402.12376, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17351","last_updated":"2025-05-23T00:07:59Z","snapshot_observed_at":"2026-08-07T14:46:18.182648Z","submitted_at":"2025-05-23T00:07:59Z","title":"FLEX: A Backbone for Diffusion-Based Modeling of Spatio-temporal Physical Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:04.112273Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2505.17351"},"observation_digest":"sha256:2b5af8bd7ac9b337958c8a0eb07a14617afcda665a320089f332f56915cda02c","observation_id":"57e1e637-586f-4d2d-a6e5-b2baf3401453","resolution":{"observed_at":"2026-08-07T14:55:04.112273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-06T20:26:37.882309Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.882309Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:823791d0ca2f4a9ad424dd5685e06b0f5c1b4c9821306f8dd3b125ef199c3d65","observation_id":"7215d8bd-8432-4be5-a886-136d3118ed11","resolution":{"observed_at":"2026-08-06T20:26:37.882309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-06T14:52:30.393598Z","title":"Fit: Flexible vision transformer for diffusion model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17795","last_updated":"2025-07-23T14:01:16Z","snapshot_observed_at":"2026-08-06T14:44:07.047902Z","submitted_at":"2025-07-23T14:01:16Z","title":"LSDM: LLM-Enhanced Spatio-temporal Diffusion Model for Service-Level Mobile Traffic Prediction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T14:52:30.393598Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2507.17795"},"observation_digest":"sha256:e9fe39cfa0f350a4a576b66de310d5df696f7cccaa1550bdb89e34883918ac55","observation_id":"bc875865-23ec-4d0a-8c9c-318b9df21e4f","resolution":{"observed_at":"2026-08-06T14:52:30.393598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-06T10:59:53.705503Z","title":"Fit: Flexible vision transformer for diffusion model.arXiv preprint arXiv:2402.12376, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23268","last_updated":"2025-08-04T02:46:11Z","snapshot_observed_at":"2026-08-06T10:59:51.682500Z","submitted_at":"2025-07-31T06:07:20Z","title":"PixNerd: Pixel Neural Field Diffusion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:59:53.705503Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2507.23268"},"observation_digest":"sha256:8f00995497a4c6eafca032cfcfffb2ab8252610ddcd0b1a8dc95e6b88a6e4a54","observation_id":"6f6e9f36-37e8-4ab2-a1b2-6c1e369abac8","resolution":{"observed_at":"2026-08-06T10:59:53.705503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-05T10:36:59.766582Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03973","last_updated":"2025-09-04T07:58:52Z","snapshot_observed_at":"2026-08-05T10:36:57.332431Z","submitted_at":"2025-09-04T07:58:52Z","title":"SAC-MIL: Spatial-Aware Correlated Multiple Instance Learning for Histopathology Whole Slide Image Classification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:59.766582Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2509.03973"},"observation_digest":"sha256:fa16e393541127f9d8d0538b9b368647d13a2cc846424dd67ecf6ab8d598571c","observation_id":"916169ce-a29e-4382-9e51-70d15fbdde50","resolution":{"observed_at":"2026-08-05T10:36:59.766582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-03T20:30:32.838768Z","title":"Fit: Flexible vision transformer for diffusion model.arXiv preprint arXiv:2402.12376, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-07T03:18:48.553937Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:32.838768Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:a4ad1cca5f7026ec0e109352fb13edb86314ccae8e0645925f81f71be01fca49","observation_id":"f64126a2-b27a-449b-8818-07cfecbbca4b","resolution":{"observed_at":"2026-08-03T20:30:32.838768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:38703eb97d0012c593e4b9e522eb2b7fed556122ad7ed2e1072f0bb8cb71fc38","observation_id":"dce0c06f-883f-4ace-84dc-3b155bf75d1c","resolution":{"observed_at":"2026-05-11T21:51:11.626899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2605.05331","last_updated":"2026-05-06T18:03:13Z","snapshot_observed_at":"2026-07-06T23:17:58.119336Z","submitted_at":"2026-05-06T18:03:13Z","title":"ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T17:06:21.438738Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2605.05331"},"observation_digest":"sha256:954e5690aed114f073a86df581c40cfe94d7bd4922f0e85a18063e942e45b916","observation_id":"e7e98791-e6ed-4797-9486-9348fea1e263","resolution":{"observed_at":"2026-05-11T17:46:17.514215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2605.09151","last_updated":"2026-05-09T20:29:24Z","snapshot_observed_at":"2026-08-07T01:10:01.218480Z","submitted_at":"2026-05-09T20:29:24Z","title":"MultiMedVision: Multi-Modal Medical Vision Framework","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T02:46:23.767997Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2605.09151"},"observation_digest":"sha256:d266ad47ed451a45b6d913c2adf0023d539fdd57b2bd2c0f92e8a4411aeaa6f9","observation_id":"1b83d50e-4033-498f-b0d2-081b0bbf721b","resolution":{"observed_at":"2026-05-12T07:31:24.744895Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2605.12491","last_updated":"2026-05-12T17:59:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T17:59:26Z","title":"Elastic Attention Cores for Scalable Vision Transformers","version":1},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-05-13T06:02:40.158866Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2605.12491"},"observation_digest":"sha256:dddcd95841144115ab15274094c404488a5302f141dc7be1379ba97c6d6099b3","observation_id":"80b15fce-7d29-4bf4-bd81-ccffd2e10c78","resolution":{"observed_at":"2026-05-13T06:07:22.645667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2605.15908","last_updated":"2026-05-15T12:45:17Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T12:45:17Z","title":"RaPD: Resolution-Agnostic Pixel Diffusion via Semantics-Enriched Implicit Representations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T19:01:52.883915Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2605.15908"},"observation_digest":"sha256:b463ddabd7fb9ac4a2329a6a4134770e36c1d9541aa3d861a1e969ecc1f77fdd","observation_id":"03cb5f2e-cef6-49ad-8295-ad057ba87be0","resolution":{"observed_at":"2026-05-20T19:03:39.585528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2605.22668","last_updated":"2026-05-21T16:09:01Z","snapshot_observed_at":"2026-08-01T09:32:22.028275Z","submitted_at":"2026-05-21T16:09:01Z","title":"SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T06:10:14.080177Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2605.22668"},"observation_digest":"sha256:26de8487ecb50c8e0bc36d09c697ff1a80c3342bec8db8421aa6c472c3cc052b","observation_id":"51fec154-7cf0-4a4a-b93a-b2ed32255ba0","resolution":{"observed_at":"2026-05-22T06:11:09.080526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.12376/citation-record","integrity":"/paper/2402.12376/integrity","json":"/paper/2402.12376/citation-record.json","paper":"/paper/2402.12376"},"outbound":[],"paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2402.12376."}