{"as_of":"2026-08-13T20:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f15d7c6dfc0eaabb99f3031fc79279cbfe3bdf3547cfc5df201d6c169d92ec8","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:42:47.923687Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.00917/citation-record","integrity":"/paper/2501.00917/integrity","json":"/paper/2501.00917/citation-record.json","paper":"/paper/2501.00917"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:47.800949Z","title":"Learning transferable visual models from na tural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.800949Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:125104ce8d31bebe91feb14a60519db104b8ffcae3dc2ca6806e6806de2f7ddb","observation_id":"9d5dcc33-ebaa-4faa-a274-ae49644a8e58","resolution":{"observed_at":"2026-08-10T22:42:47.800949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:48.423235Z","title":"Fla mingo: a visual language model for few-shot learning,","venue":null,"work_id":"0befdc13-760f-4217-8a6f-6d0afe8889e9","year":2022},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.806179Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:d6c9c19d997b0ffc48a1337d83901eac720ac6d8c6c9ffc46e85c855ec3a0709","observation_id":"3e59bc6d-8dad-4484-b063-ceca84274ef6","resolution":{"observed_at":"2026-08-10T22:42:48.429136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19732","last_updated":"2024-12-20T16:19:17Z","snapshot_observed_at":"2026-08-12T22:14:56.544158Z","submitted_at":"2024-10-25T17:59:09Z","title":"Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19732","snapshot_observed_at":"2026-08-10T22:42:47.810775Z","title":"Rethinking visual de pendency in long-context reasoning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.810775Z"},"links":{"cited_paper":"/paper/2410.19732","citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:fa7831380bbf436094a58ed10a02821afa2bd22ee44cf9a740b06b9c23fee222","observation_id":"6f6057e7-6a52-4df8-ae77-6a10ae1c2804","resolution":{"observed_at":"2026-08-10T22:42:47.810775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12044","last_updated":"2024-12-02T10:17:48Z","snapshot_observed_at":"2026-08-12T23:40:40.288501Z","submitted_at":"2024-06-17T19:31:24Z","title":"ARTIST: Improving the Generation of Text-rich Images with Disentangled Diffusion Models and Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.12044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.12044","snapshot_observed_at":"2026-08-10T22:42:48.227853Z","title":"ARTIST: Improving the Generation of Text-rich Images with Disentangled Diffusion Models and Large Language Models","venue":"cs.CV","work_id":"4e17d377-60c1-4f1e-81d0-dcf4622be291","year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.816050Z"},"links":{"cited_paper":"/paper/2406.12044","citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:4c155a1c7622dbc1decf85b6e3dd0270a873f8aab0f86cf51dd9b0b38f19dcba","observation_id":"c70eaa7e-504a-4f3f-8c2a-a913f2faba0b","resolution":{"observed_at":"2026-08-10T22:42:48.232622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:48.408187Z","title":"Textd iffuser: Diffusion models as text painters,","venue":null,"work_id":"9b6b40fa-0a1f-4973-9eb4-b33f879a60a6","year":2023},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.820974Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:3f98f9437b2d17abf17621a0eae72c2dd7358da4a8c1688fce6ff11207c2fdb5","observation_id":"839626a2-47b2-4584-8e5f-aee86d62c9c1","resolution":{"observed_at":"2026-08-10T22:42:48.413065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-13T13:10:50.058243Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-10T22:42:47.825552Z","title":"Muse: Text-to- image generation via masked generative transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.825552Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:dbefbb9000c15736fed5c22070b768b3f6a6d6dbd17e38c3a580320a9463c5cf","observation_id":"2842a8d5-f723-4814-a821-3dd074fbe122","resolution":{"observed_at":"2026-08-10T22:42:47.825552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10797","last_updated":"2025-02-19T06:00:55Z","snapshot_observed_at":"2026-08-12T23:41:55.204742Z","submitted_at":"2024-06-16T03:45:45Z","title":"STAR: Scale-wise Text-conditioned AutoRegressive image generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10797","snapshot_observed_at":"2026-08-10T22:42:47.830666Z","title":"Star: Scale-wise text-to-image generation via auto-regressive representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.830666Z"},"links":{"cited_paper":"/paper/2406.10797","citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:a7c1bca7acb3ec849c79d7e11629a51c50df9b6c0f43c9e9426bbd3937d553c5","observation_id":"7d478ed2-71ab-4f85-8e57-07ab9d33de9c","resolution":{"observed_at":"2026-08-10T22:42:47.830666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-08-12T22:03:51.089391Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-08-10T22:42:47.835262Z","title":"Region-aware text-to-image generation via har d binding and soft reﬁnement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.835262Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:4960e304aa71aee307c83e3300f59773bfe8bdfc51ed681699b1c501f0efe62e","observation_id":"3aad78ac-da31-432d-9ade-f8e89ecaf145","resolution":{"observed_at":"2026-08-10T22:42:47.835262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:48.392725Z","title":"An analysis of the ingredients for learning interpretable symbolic regression models with human-in-the-loop and genetic prog ramming,","venue":null,"work_id":"df71e2ca-9c4c-4416-a412-d2896499ae1f","year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.839951Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:c1fb52f905163bd7a30e4bf2af89f2a603b4ed6dd4cb8c9b989a0faf1c62db66","observation_id":"f9de7c66-9b72-4071-95e3-3028d3157f0b","resolution":{"observed_at":"2026-08-10T22:42:48.397720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:47.843949Z","title":"Improving cross-modal alignment f or text- guided image inpainting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.843949Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:5e87d18cfc59f14ea4c4bac006d6ffcd0d368e14d31ff2d1ac55c68fd9127172","observation_id":"d0ff0900-95db-490d-bbb6-8994ba843467","resolution":{"observed_at":"2026-08-10T22:42:47.843949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:48.368923Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":"d3e5dcdd-0102-493a-b415-2b172bd7f2d8","year":2021},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.847927Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:863e943895f686d7d0a4460fc9d2f10f1550b8b686c3125a0f7f2274a85c0e53","observation_id":"ee5d1221-7ff3-4ab9-939b-13f0fb837801","resolution":{"observed_at":"2026-08-10T22:42:48.373659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:48.354556Z","title":"Towards language-driven video inpainting via multimoda l large language models,","venue":null,"work_id":"12555eee-db99-45f8-bfaf-995fac860321","year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.852061Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:b71d24a80e090609321f04813a46a999914c032a50195a1a0276a3a9f2d581e4","observation_id":"cd633819-6bf3-46c3-a9c4-4a84c31ee2ed","resolution":{"observed_at":"2026-08-10T22:42:48.359278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16720","last_updated":"2023-12-27T21:12:21Z","snapshot_observed_at":"2026-08-13T14:41:44.020677Z","submitted_at":"2023-12-27T21:12:21Z","title":"Prompt Expansion for Adaptive Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16720","snapshot_observed_at":"2026-08-10T22:42:47.856445Z","title":"Prom pt expansion for adaptive text-to-image generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.856445Z"},"links":{"cited_paper":"/paper/2312.16720","citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:0d19a3e32fc90b7e6d816d3e8da6974cbdc6c81f36128cc4fdc15a749a017d5b","observation_id":"7df5d13b-9bd0-4922-82e1-58ada63d4361","resolution":{"observed_at":"2026-08-10T22:42:47.856445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:48.339915Z","title":"Training-free consistent text-to-image gener ation,","venue":null,"work_id":"b2cc2f0d-1e92-44e9-b005-b449d0d30df0","year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.861291Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:5da1b7875bc8725a4d8edf06ced7b96a1172f2fd47d0c9d32a60b1a9f6f831e6","observation_id":"5bd31eed-2ce6-4aca-b6db-8362b87569cd","resolution":{"observed_at":"2026-08-10T22:42:48.344419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:47.865685Z","title":"Style-aware contrastive learning for multi-style image captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.865685Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:c0c78606d4f643a4bbd09564e660e175c403369f6b739e372436affe4fb7d3af","observation_id":"b92ebe12-0373-493b-baff-f96f1d5f8d6a","resolution":{"observed_at":"2026-08-10T22:42:47.865685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:48.315373Z","title":"Multimodal event transformer for image-guided st ory ending generation,","venue":null,"work_id":"fae422ff-0749-4926-9a6e-c4cb7b9e83bb","year":2023},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.869872Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:2e62c4cc459f0af9a821368e88282807f21cacfb5aeb5cdce2ccdb83b1b05dc2","observation_id":"eedea3d6-b472-4ad6-86aa-c758ef8bb01f","resolution":{"observed_at":"2026-08-10T22:42:48.320620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:47.874406Z","title":"Triple sequence generati ve adversarial nets for unsupervised image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.874406Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:54a6b1adc41f1af51d8092c6cc6e72960fc4a6fc1c12c508c09726ebfaa8be4a","observation_id":"4f700a97-5b4f-44d2-919d-8013fd81e193","resolution":{"observed_at":"2026-08-10T22:42:47.874406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:47.878734Z","title":"Sketch storytelling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.878734Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:e1f2e9e6becdd08156c9dbd66a68e51f1ee6329ecb72821c18c04deb2d36c79e","observation_id":"ccda3c91-5b5b-4ba9-b9f4-0efd3f4651b2","resolution":{"observed_at":"2026-08-10T22:42:47.878734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05496","last_updated":"2024-06-08T15:30:46Z","snapshot_observed_at":"2026-08-12T23:47:18.138975Z","submitted_at":"2024-06-08T15:30:46Z","title":"Generalist Multimodal AI: A Review of Architectures, Challenges and Opportunities","version":1},"cited_work":{"arxiv_id":"2406.05496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.05496","snapshot_observed_at":"2026-08-10T22:42:48.148154Z","title":"Generalist Multimodal AI: A Review of Architectures, Challenges and Opportunities","venue":"cs.CL","work_id":"5faf27ed-3965-42f7-a3f3-1377f075a755","year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.882788Z"},"links":{"cited_paper":"/paper/2406.05496","citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:7f3da994462839118c266de28619a1899eaad382af33096ecd3100c44aa471b1","observation_id":"70acb0cc-a645-4cc5-9b12-9da7a0068e37","resolution":{"observed_at":"2026-08-10T22:42:48.155107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09691","last_updated":"2024-11-14T18:57:07Z","snapshot_observed_at":"2026-08-12T20:20:39.448843Z","submitted_at":"2024-11-14T18:57:07Z","title":"Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09691","snapshot_observed_at":"2026-08-10T22:42:47.887679Z","title":"Advancing ﬁne-grained visual underst anding with multi-scale alignment in multi-modal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.887679Z"},"links":{"cited_paper":"/paper/2411.09691","citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:2a59736be6cc38183564122eb4e33fe7e78eb1828dfabbaa8c16567a4eb53a6c","observation_id":"84865179-7f60-4189-a0b0-b616a27b54b6","resolution":{"observed_at":"2026-08-10T22:42:47.887679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:47.892120Z","title":"Visual in-context l earning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.892120Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:8fa2cfa6419385466fa011e95fb84fe58935ffe9d407b86ed5a61fe0be782557","observation_id":"4647b3ae-dcd7-4ef3-89b5-b507a7c7b778","resolution":{"observed_at":"2026-08-10T22:42:47.892120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-13T05:45:31.410659Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-10T22:42:47.896528Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual input an d output,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.896528Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:150d669172ebb40dca1d62da9afc4581527c02c69539f0756d9077c6f70b3f14","observation_id":"050b7709-0670-4258-b108-1e6a93eb91af","resolution":{"observed_at":"2026-08-10T22:42:47.896528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-10T22:42:47.901252Z","title":"Moe-llava: Mixture of experts for large vision -language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.901252Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:791d3852d174b4d092b2e04b2668fcfafd79fa8170502bfdf53f858e854696d9","observation_id":"31b6ca13-b271-4ac6-8df8-52467eeb0a85","resolution":{"observed_at":"2026-08-10T22:42:47.901252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13734","last_updated":"2024-07-18T17:35:32Z","snapshot_observed_at":"2026-08-12T23:19:15.417284Z","submitted_at":"2024-07-18T17:35:32Z","title":"Understanding Reinforcement Learning-Based Fine-Tuning of Diffusion Models: A Tutorial and Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13734","snapshot_observed_at":"2026-08-10T22:42:47.905883Z","title":"Under standing reinforcement learning-based ﬁne-tuning of diffusion mod els: A tutorial and review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.905883Z"},"links":{"cited_paper":"/paper/2407.13734","citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:28c6b1cf812127f91338d210968ffd8f48fd79106a4095dcbfff5ae2532fff78","observation_id":"6672227c-d77f-4391-9712-fa755c0eb995","resolution":{"observed_at":"2026-08-10T22:42:47.905883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-08-12T23:02:42.757635Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-10T22:42:47.910468Z","title":"A survey on benchmarks of multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.910468Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:c5ae57bc67c59c903e4683b62356c5c94f8ecba860bf0fa1f900a67071c373dc","observation_id":"14e2375b-3758-4254-9be4-f3b03b6a1106","resolution":{"observed_at":"2026-08-10T22:42:47.910468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:47.914817Z","title":"Ex ploring the frontier of vision-language models: A survey of current met hodologies and future directions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.914817Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:e58f6f008520d7daf1b92af56b8c2ea7e13597602ff5df70f0a08378f42cc6a8","observation_id":"4261da68-09ad-43cd-84e4-f7848eafff97","resolution":{"observed_at":"2026-08-10T22:42:47.914817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:48.272074Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks,","venue":null,"work_id":"aae18542-2ac0-4a3f-a716-3fa8594dc11b","year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.918957Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:e0a3e43ba2165aa376de436a4fa48194d7291a6b410c5d68ee961557a80055a8","observation_id":"4bc47a9f-7762-4e47-aefd-26d990754358","resolution":{"observed_at":"2026-08-10T22:42:48.276806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:42:48.257971Z","title":"Less is more: Vision representation compression for efﬁcient video gene ration with large language models,","venue":null,"work_id":"f0114a29-03ff-48af-8a21-dddb595bab60","year":2024},"citing_paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:42:47.923687Z"},"links":{"citing_paper":"/paper/2501.00917"},"observation_digest":"sha256:5a506b2b3311b9e1052456b6b71f3fa3dea39897244de0aac9227eb6df28633d","observation_id":"b2e9a579-3d1b-43c4-9baf-103d1b168642","resolution":{"observed_at":"2026-08-10T22:42:48.262399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.00917","last_updated":"2025-01-01T18:27:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T18:07:29.585582Z","submitted_at":"2025-01-01T18:27:13Z","title":"Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":9},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2501.00917."}