{"as_of":"2026-08-07T15:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32145c58e05a44f4a77fcbd44131aed26c8cb5621660796ac8fd7328fdcf25b9","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:26:37.951818Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:58:15.910837Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T08:55:35.719491Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"cited_work":{"arxiv_id":"2507.02713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02713","snapshot_observed_at":"2026-07-01T08:55:35.719491Z","title":"arXiv preprint arXiv:2507.02713 (2025) 3","venue":null,"work_id":"f26c2d86-18d8-49b9-9777-90ee2340660d","year":2025},"citing_paper":{"arxiv_id":"2606.31029","last_updated":"2026-06-30T01:56:41Z","snapshot_observed_at":"2026-08-02T19:20:46.455056Z","submitted_at":"2026-06-30T01:56:41Z","title":"TerraDiT-$\\Omega$: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T06:58:15.910837Z"},"links":{"cited_paper":"/paper/2507.02713","citing_paper":"/paper/2606.31029"},"observation_digest":"sha256:fe792f750d738a6713740dd1898dff769eda6aa9851b4c9b7a8bdf5bcba6c33a","observation_id":"19d9ffe3-fda1-4681-b56d-7aa338b5475f","resolution":{"observed_at":"2026-07-01T08:55:35.721118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02713/citation-record","integrity":"/paper/2507.02713/integrity","json":"/paper/2507.02713/citation-record.json","paper":"/paper/2507.02713"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T20:26:37.829974Z","title":"L., Kiros, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.829974Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:63b94deccbad9a5a4a1d4b224bb3a320bfa43f407118c91d301dbe55dbc448b1","observation_id":"18a8a7e8-d58f-436a-829a-374dee2eb931","resolution":{"observed_at":"2026-08-06T20:26:37.829974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17270","last_updated":"2024-02-22T13:05:52Z","snapshot_observed_at":"2026-08-06T03:42:49.390767Z","submitted_at":"2024-01-30T18:59:38Z","title":"YOLO-World: Real-Time Open-Vocabulary Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17270","snapshot_observed_at":"2026-08-06T20:26:37.846808Z","title":"Yolo-world: Real-time open-vocabulary object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.846808Z"},"links":{"cited_paper":"/paper/2401.17270","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:286620f60a4c4b1132517354ddaeadf12694aa92198b2840863feba0fc9e635b","observation_id":"0ce664aa-8222-4bee-a01d-41e488039fde","resolution":{"observed_at":"2026-08-06T20:26:37.846808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:38.341768Z","title":"Other works (Esser et al., 2024; Chen et al., 2023; OpenAI, 2024a; Gao et al., 2024; Li et al., 2024b; Xie et al., 2023; Nair et al.,","venue":null,"work_id":"f5132327-2192-4697-9525-fddfaad56703","year":1962},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.930053Z"},"links":{"citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:7237c802595493688a34b55adfee821c7cc7e07bf8f48df27897842b163560a5","observation_id":"4a86b7fb-5a21-456b-b4c0-e8a9e72225e8","resolution":{"observed_at":"2026-08-06T20:26:38.345732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:38.282218Z","title":"Orange kittenwith bright blue eyes on rocky ground","venue":null,"work_id":"85d20f79-e470-473a-a45e-c22028691d87","year":2021},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.951818Z"},"links":{"citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:8664e6f635287e25ee1f79a9d4e33f1aba7d152189e45fd938e4e8e9caa8c5bf","observation_id":"4459dfd4-ebc3-4b8e-a686-1c3c4491139d","resolution":{"observed_at":"2026-08-06T20:26:38.285944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T20:26:37.861949Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.861949Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:b39f9c00ee12ac7f2380f4863b579ba05680b0989dc2b14dcb029d67c6307c7e","observation_id":"c21c29c2-f788-422c-9333-00e92ba0796d","resolution":{"observed_at":"2026-08-06T20:26:37.861949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07399","last_updated":"2023-07-03T03:06:26Z","snapshot_observed_at":"2026-08-03T06:41:22.144754Z","submitted_at":"2023-03-13T18:26:11Z","title":"RTMPose: Real-Time Multi-Person Pose Estimation based on MMPose","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07399","snapshot_observed_at":"2026-08-06T20:26:37.868943Z","title":"Rtmpose: Real-time multi-person pose estimation based on mmpose","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.868943Z"},"links":{"cited_paper":"/paper/2303.07399","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:9085cac277e908013cb71dacffeff62b872ced7d75054c3fd058da073bf43585","observation_id":"50d7046c-663c-4008-9ad5-29b874c4478b","resolution":{"observed_at":"2026-08-06T20:26:37.868943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T20:26:37.875779Z","title":"Hunyuan- dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.875779Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:fdc3c015164847df3af76d972c9207b5a7b186f9122e265aaaea3bc35acba199","observation_id":"01613cf8-1f4b-4777-9245-2199ba8b590b","resolution":{"observed_at":"2026-08-06T20:26:37.875779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-07-06T17:32:24.161667Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-06T20:26:37.882309Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.882309Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:823791d0ca2f4a9ad424dd5685e06b0f5c1b4c9821306f8dd3b125ef199c3d65","observation_id":"7215d8bd-8432-4be5-a886-136d3118ed11","resolution":{"observed_at":"2026-08-06T20:26:37.882309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08740","last_updated":"2024-09-23T15:59:41Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-16T18:55:25Z","title":"SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08740","snapshot_observed_at":"2026-08-06T20:26:37.885766Z","title":"S., Boffi, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.885766Z"},"links":{"cited_paper":"/paper/2401.08740","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:2b70a972d45966916a828acfb3324770b59993cb59b2b09a0865e1c0e9bb3ac0","observation_id":"8b242ca2-ef67-4c57-a9a8-d9dda2a33e65","resolution":{"observed_at":"2026-08-06T20:26:37.885766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09976","last_updated":"2024-04-15T17:55:43Z","snapshot_observed_at":"2026-08-06T01:48:42.883153Z","submitted_at":"2024-04-15T17:55:43Z","title":"Diffscaler: Enhancing the Generative Prowess of Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2404.09976","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.09976","snapshot_observed_at":"2026-08-06T20:26:38.076140Z","title":"Diffscaler: Enhancing the Generative Prowess of Diffusion Transformers","venue":"cs.CV","work_id":"128b3b76-967f-488e-bb78-174f10216455","year":2024},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.889061Z"},"links":{"cited_paper":"/paper/2404.09976","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:94b7d8402ee627d7baa58d6f016ff3238b3e9065ab878b5e002da5153dc4207a","observation_id":"d997714a-58dc-400b-a68f-f60983debfc6","resolution":{"observed_at":"2026-08-06T20:26:38.080385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T20:26:37.893082Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.893082Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:fbc70928e38f4fc7e0a8643e616c1cadbda8ea862820cb08ca7fb776117600f1","observation_id":"e46863c8-3d73-4bb5-90f9-27a220622298","resolution":{"observed_at":"2026-08-06T20:26:37.893082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02730","last_updated":"2024-10-30T16:13:42Z","snapshot_observed_at":"2026-07-06T18:09:51.117905Z","submitted_at":"2024-05-04T18:27:29Z","title":"U-DiTs: Downsample Tokens in U-Shaped Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02730","snapshot_observed_at":"2026-08-06T20:26:37.899687Z","title":"U-dits: Downsample tokens in u-shaped diffusion trans- formers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.899687Z"},"links":{"cited_paper":"/paper/2405.02730","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:7e65ed169621137b8e598af2250aa9cdcc14946730f9b456d477bcd15daec7fb","observation_id":"34055887-880b-46fb-bc8a-0a98c08cd7dc","resolution":{"observed_at":"2026-08-06T20:26:37.899687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:37.903085Z","title":"Plug- and-play diffusion features for text-driven image-to- image translation","venue":null,"work_id":null,"year":1921},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.903085Z"},"links":{"citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:25d5185476459ad028817ff49ef5d5ecbd1786784165967971ca254a4c142ec7","observation_id":"4c00fb91-bada-4d3b-8495-fda0d80c9b88","resolution":{"observed_at":"2026-08-06T20:26:37.903085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-06T20:26:37.906594Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.906594Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:d865ad47dac59ec78a2ba189c11754f9fc294356a4d500f1919411a264d39bf3","observation_id":"546da1e9-c8f0-4b9f-8677-79a3345d2600","resolution":{"observed_at":"2026-08-06T20:26:37.906594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03290","last_updated":"2024-02-05T18:49:17Z","snapshot_observed_at":"2026-08-06T08:11:36.010824Z","submitted_at":"2024-02-05T18:49:17Z","title":"InstanceDiffusion: Instance-level Control for Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03290","snapshot_observed_at":"2026-08-06T20:26:37.910026Z","title":"S., Girdhar, R., and Misra, I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.910026Z"},"links":{"cited_paper":"/paper/2402.03290","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:dc8d18631556b58da10f1498b082721228a9145d3128bf87f71900d0348d7c47","observation_id":"a97ff1bb-d775-4d86-b0e4-feeb561fb681","resolution":{"observed_at":"2026-08-06T20:26:37.910026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14017","last_updated":"2025-06-25T14:45:49Z","snapshot_observed_at":"2026-07-06T18:18:12.096996Z","submitted_at":"2024-05-22T21:51:01Z","title":"MagicPose4D: Crafting Articulated Models with Appearance and Motion Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14017","snapshot_observed_at":"2026-08-06T20:26:37.913412Z","title":"Magicpose4d: Crafting articulated models with appearance and motion control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.913412Z"},"links":{"cited_paper":"/paper/2405.14017","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:4de051883fe818207047f465ce5581b2cfd3e813905637b4b493cb2150730c95","observation_id":"1ef55050-4ddb-493d-af15-66ccca64d5a0","resolution":{"observed_at":"2026-08-06T20:26:37.913412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05408","last_updated":"2024-02-27T08:04:11Z","snapshot_observed_at":"2026-07-06T17:27:15.921312Z","submitted_at":"2024-02-08T04:52:36Z","title":"MIGC: Multi-Instance Generation Controller for Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":"2402.05408","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.05408","snapshot_observed_at":"2026-08-06T20:26:37.984479Z","title":"MIGC: Multi-Instance Generation Controller for Text-to-Image Synthesis","venue":"cs.CV","work_id":"99669eb9-fbeb-43be-8519-7a9122b71523","year":2024},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.916573Z"},"links":{"cited_paper":"/paper/2402.05408","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:4c98269eef2c192825a71368abb701a89a70a159e9f3cf6e803bb13937c490f7","observation_id":"076047ce-e063-4916-ae4b-eb62f3a7ba30","resolution":{"observed_at":"2026-08-06T20:26:37.990345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:38.374503Z","title":"Dataset A.1","venue":null,"work_id":"a1b26683-fdc0-4609-95b2-9d53087100b4","year":2024},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.920187Z"},"links":{"citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:94a7d4fea5e65db3779fc7b81d451ef3a20dc4d1309559022e5928c3a13a1ba3","observation_id":"6a3e5616-3fab-43f9-84b3-eaaf67b1dc47","resolution":{"observed_at":"2026-08-06T20:26:38.377852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:38.363960Z","title":null,"venue":null,"work_id":"0a232b58-2646-4ccd-b5a7-170179cdddae","year":2023},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.923599Z"},"links":{"citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:84d88a35b56073d7d2241dd88299a3c5d7739f1ea4b897580685e15dcd7c60ee","observation_id":"5744c3c2-3163-4b75-af18-0695f3ca3986","resolution":{"observed_at":"2026-08-06T20:26:38.367393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:38.353553Z","title":null,"venue":null,"work_id":"68b569de-3f61-48a9-8def-45ac0e6aac96","year":2023},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.926726Z"},"links":{"citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:50c4648bc6225c0a1e008f027b5b45a398943906c06343ba2779cfcaa358eabf","observation_id":"53db4ca1-4d6f-46f0-8937-f1de40e25cdb","resolution":{"observed_at":"2026-08-06T20:26:38.356929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:38.328538Z","title":"In this work, we use PIXART-α as our backbone, which is a variant of DiT (Peebles & Xie, 2023)","venue":null,"work_id":"be032043-4c68-44ac-b279-926bcd17b4cf","year":2023},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.933292Z"},"links":{"citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:5a64c4a804c423546ec9d30357f1204ba65e9a1e9e7d58c54130115b41ea1ba7","observation_id":"a793e732-afa4-499e-b52b-adaf3782c812","resolution":{"observed_at":"2026-08-06T20:26:38.332672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:38.317081Z","title":"During the sampling process, the model can transform Gaussian noise of normal distribution to real samples step-by-step","venue":null,"work_id":"204e5533-e7ba-409e-9036-3ed30cc34ac3","year":2015},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.937078Z"},"links":{"citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:b96ce1f8d435d6f1ac09b49c3162c5766cf9922fb0ab5d5d29a8020307807c8e","observation_id":"2d81187c-e584-48ed-bdca-80089b5f3f4c","resolution":{"observed_at":"2026-08-06T20:26:38.320860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:38.305197Z","title":"Latent Diffusion Model & PIXART-α","venue":null,"work_id":"4f6be84d-850e-45ee-8623-2f31350b21b0","year":2022},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.941904Z"},"links":{"citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:80797bd7091ebe57d5d58890efdc46a9550d5251b2f25549faa9390c7d1d41d0","observation_id":"8fb12fa2-5987-4aef-a44b-4a71474f2a56","resolution":{"observed_at":"2026-08-06T20:26:38.309040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:38.293497Z","title":"At the inference stage, we can reconstruct the generated image through the decoder ˆx = D(ˆz)","venue":null,"work_id":"2cc0f420-2e37-4e22-b3b4-55fbe7fa3aa4","year":2022},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.947189Z"},"links":{"citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:e1b2d9b4e6ec862882f3e650c6ad92e80b3a22bbb7b08468db8d491341f5c01a","observation_id":"a77f4d82-7611-4f2b-b617-79222886e324","resolution":{"observed_at":"2026-08-06T20:26:38.297545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T20:26:37.879007Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.879007Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:d5a58742c19f630a32ff5518192729ac037ffeae3e32d978f4807f98f8e02c24","observation_id":"be50e2ba-d19a-4114-aa3d-92c320cc81b9","resolution":{"observed_at":"2026-08-06T20:26:37.879007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00249","last_updated":"2021-07-31T14:34:40Z","snapshot_observed_at":"2026-08-04T02:27:35.993562Z","submitted_at":"2021-07-31T14:34:40Z","title":"SyDog: A Synthetic Dog Dataset for Improved 2D Pose Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.00249","snapshot_observed_at":"2026-08-06T20:26:37.896114Z","title":"11 UNIMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation Laion-aesthetics v2, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.896114Z"},"links":{"cited_paper":"/paper/2108.00249","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:7212a55e7070f73df9931719ea95ab8591694c0415f4b489f3719582d553d728","observation_id":"b0b1cdd5-10a6-46bd-92b0-d2a793596c66","resolution":{"observed_at":"2026-08-06T20:26:37.896114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T20:26:37.835389Z","title":"Qwen-vl: A frontier large vision- language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.835389Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:0d947bb6c17906b390c90ffaba4502b90b1969ef140ce8da5d4fe163e0e6782f","observation_id":"66b5de23-ce72-49b8-9087-f6d3de5844cc","resolution":{"observed_at":"2026-08-06T20:26:37.835389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T20:26:37.842944Z","title":"Pixart-\\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.842944Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:75ef87e874095c6faadf974fee2d48895d37a8851d663dcfe607a63a8639cab3","observation_id":"1c6e5d5b-eb49-4408-9bf2-6a90c31c6534","resolution":{"observed_at":"2026-08-06T20:26:37.842944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02139","last_updated":"2024-08-29T03:09:40Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:57:01Z","title":"DiffiT: Diffusion Vision Transformers for Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02139","snapshot_observed_at":"2026-08-06T20:26:37.858456Z","title":"Diffit: Diffusion vision transformers for image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.858456Z"},"links":{"cited_paper":"/paper/2312.02139","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:038236f53d50945b25743628e4ee990df6918c8d295b6182abea4d09aaff793a","observation_id":"1e9c2a99-12d5-4a3d-ba4f-936d9f692126","resolution":{"observed_at":"2026-08-06T20:26:37.858456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-06T20:26:37.865492Z","title":"Animate anyone: Consistent and controllable image-to- video synthesis for character animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.865492Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:10aafb12fcf304fef9c1ec84f35da031321fbf7e8c63f282480ff8f453ca9a83","observation_id":"16d69922-5558-45b9-be06-f30d5f5af92e","resolution":{"observed_at":"2026-08-06T20:26:37.865492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-06T20:26:37.850431Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.850431Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:78555b81789aa6f9f8f4a7a4d483b55b88db1c3417c592da229a0ea7fe89b890","observation_id":"826e5b75-7a8c-4d47-9523-abc80896f559","resolution":{"observed_at":"2026-08-06T20:26:37.850431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-06T20:26:37.854469Z","title":"Lumina-t2x: Transform- ing text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.854469Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:7cf8a3a7ab9fba51610d3c57795feb5c67bb9877a8a33b78924ed96036390134","observation_id":"507a892c-920f-4d4f-8c5d-79a184db2557","resolution":{"observed_at":"2026-08-06T20:26:37.854469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01401","last_updated":"2021-01-14T05:36:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T15:25:26Z","title":"Demystifying MMD GANs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01401","snapshot_observed_at":"2026-08-06T20:26:37.839095Z","title":"J., Arbel, M., and Gret- ton, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.839095Z"},"links":{"cited_paper":"/paper/1801.01401","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:02b3053c2f30c1f1c16295f3d0235eda4733c642edf27901c6e324eb5b875d39","observation_id":"aff6a9c9-759d-4e83-9fbd-d7349d8a2396","resolution":{"observed_at":"2026-08-06T20:26:37.839095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01294","last_updated":"2024-04-01T17:59:05Z","snapshot_observed_at":"2026-08-04T22:14:52.978694Z","submitted_at":"2024-04-01T17:59:05Z","title":"CosmicMan: A Text-to-Image Foundation Model for Humans","version":1},"cited_work":{"arxiv_id":"2404.01294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01294","snapshot_observed_at":"2026-08-06T20:26:38.147214Z","title":"CosmicMan: A Text-to-Image Foundation Model for Humans","venue":"cs.CV","work_id":"6daa256d-76ce-4248-903d-37e7d1e24928","year":2024},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.872458Z"},"links":{"cited_paper":"/paper/2404.01294","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:f83da304772d2bb7422deab0863778ec864d6f9fc27e4a9b28d3b99ceb1a41c0","observation_id":"c8e0e912-55f9-409c-8f16-dbe75a0f90cf","resolution":{"observed_at":"2026-08-06T20:26:38.150909Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":24,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2507.02713."}