{"as_of":"2026-08-07T12:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6eb80def62fe4ae047cdc8814e88526ef68d964ab520e6f4831dea444802805c","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:58:05.710909Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04152/citation-record","integrity":"/paper/2507.04152/integrity","json":"/paper/2507.04152/citation-record.json","paper":"/paper/2507.04152"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:01.645874Z","title":"Less is more: Vision representation compression for efficient video generation with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:01.645874Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:b80f293587e7243c4e51efcf7903b444f16936aaddf9c3123aaed88debada855","observation_id":"24e861b9-5e24-4d5c-b14f-c57bdddf08a3","resolution":{"observed_at":"2026-08-06T19:58:01.645874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-06T19:58:01.720824Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:01.720824Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:24e08c8cda4934981cd4dbd1d3b6e8ce009a9bfd63611ead0e91a84844a96c36","observation_id":"bd2cd77b-15f5-4468-8e93-83283b1ebdde","resolution":{"observed_at":"2026-08-06T19:58:01.720824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-08-07T12:11:21.020257Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24787","snapshot_observed_at":"2026-08-06T19:58:01.777284Z","title":"Draw all your imagine: A holistic benchmark and agent framework for complex instruction-based image generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:01.777284Z"},"links":{"cited_paper":"/paper/2505.24787","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:ce23d1b9e4b59b0490a00443c08d6bc0078f21630d4119dedc7eac0c16a1f266","observation_id":"21eb0ce8-b794-4f5c-af95-7c5121abd867","resolution":{"observed_at":"2026-08-06T19:58:01.777284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12830","last_updated":"2025-06-15T12:22:55Z","snapshot_observed_at":"2026-08-07T00:34:18.865020Z","submitted_at":"2025-06-15T12:22:55Z","title":"ComplexBench-Edit: Benchmarking Complex Instruction-Driven Image Editing via Compositional Dependencies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12830","snapshot_observed_at":"2026-08-06T19:58:01.897972Z","title":"Complexbench- edit: Benchmarking complex instruction-driven image editing via com- positional dependencies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:01.897972Z"},"links":{"cited_paper":"/paper/2506.12830","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:aa5802a849a2759ee4c97e1f259c19e171259056ecdadd2c740f659def1bfb0e","observation_id":"054b8275-6e6b-4a44-b369-6d7e14b4fa48","resolution":{"observed_at":"2026-08-06T19:58:01.897972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:02.079218Z","title":"Weak to strong generalization for large language models with multi-capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.079218Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:76567be1f742576b716e4a749d11deab2b765082bb2c7ccff263cfe51c0d48f4","observation_id":"32798ebe-4040-4612-baa4-705948485c0f","resolution":{"observed_at":"2026-08-06T19:58:02.079218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12432","last_updated":"2025-05-25T13:59:04Z","snapshot_observed_at":"2026-08-07T08:09:08.223198Z","submitted_at":"2025-01-21T16:49:08Z","title":"Divide-Then-Aggregate: An Efficient Tool Learning Method via Parallel Tool Invocation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12432","snapshot_observed_at":"2026-08-06T19:58:02.300391Z","title":"Divide-then-aggregate: An efficient tool learning method via parallel tool invocation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.300391Z"},"links":{"cited_paper":"/paper/2501.12432","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:a208c28b5485bb1da15fcad9e233d946d6e5da530c97a38755683d584d0cf7c4","observation_id":"41fc1007-da5b-4686-a218-a3d82559baac","resolution":{"observed_at":"2026-08-06T19:58:02.300391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08734","last_updated":"2023-11-15T06:54:44Z","snapshot_observed_at":"2026-08-06T23:57:01.440666Z","submitted_at":"2023-11-15T06:54:44Z","title":"Thread of Thought Unraveling Chaotic Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08734","snapshot_observed_at":"2026-08-06T19:58:02.468597Z","title":"Thread of thought unraveling chaotic contexts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.468597Z"},"links":{"cited_paper":"/paper/2311.08734","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:fa9d3e0a352e7e279718dcee7f18fa982d41bc85b27defb588c7eccb8cd98cfc","observation_id":"1365ae65-0aae-44aa-870f-f3af36727cbd","resolution":{"observed_at":"2026-08-06T19:58:02.468597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:07.959066Z","title":"Hierarchical reinforcement learning for handling sparse rewards in multi-goal navigation,","venue":null,"work_id":"df72170e-596b-41e2-80a6-1af36db1dedf","year":2024},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.608469Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:943eef63c6a9cdb9a712a7d3a3ab4da43bc0f88eab44d4e0d0c46ef031677f49","observation_id":"0b17ec1a-4b49-4687-8b59-22e9adaa2801","resolution":{"observed_at":"2026-08-06T19:58:08.041512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07818","last_updated":"2022-08-16T16:07:05Z","snapshot_observed_at":"2026-07-06T13:42:24.750714Z","submitted_at":"2022-08-16T16:07:05Z","title":"Training Latent Variable Models with Auto-encoding Variational Bayes: A Tutorial","version":1},"cited_work":{"arxiv_id":"2208.07818","doi":"10.48550/arxiv.2208.07818","metadata_source":"pith","pith_arxiv_id":"2208.07818","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"Training Latent Variable Models with Auto-encoding Variational Bayes: A Tutorial","venue":"cs.LG","work_id":"553b1d40-a3a6-44cd-97ea-fa1328aa79b1","year":2022},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.725421Z"},"links":{"cited_paper":"/paper/2208.07818","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:114f9fb836446ebbcdbd1c40917886c95964d04e7e2525f8a06eba88ab4259bb","observation_id":"a915607f-1aca-4343-b396-04f7df7932c0","resolution":{"observed_at":"2026-08-06T19:58:06.318947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.07793","last_updated":"2020-02-07T18:11:58Z","snapshot_observed_at":"2026-07-06T07:46:31.893420Z","submitted_at":"2019-04-16T16:26:19Z","title":"AT-GAN: An Adversarial Generator Model for Non-constrained Adversarial Examples","version":4},"cited_work":{"arxiv_id":"1904.07793","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.07793","snapshot_observed_at":"2026-08-06T19:58:07.357831Z","title":"AT-GAN: An Adversarial Generator Model for Non-constrained Adversarial Examples","venue":"cs.CV","work_id":"c179a5ff-d401-4c6b-a7f6-7fc9e3b83d1a","year":2019},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.846209Z"},"links":{"cited_paper":"/paper/1904.07793","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:3579f6f330380d4d33b2c22079f6413e099ede78c5d47c06f03bb4b1ca36f25c","observation_id":"b8063857-6afa-433f-a5f5-9f827a0a859d","resolution":{"observed_at":"2026-08-06T19:58:07.424502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:07.844292Z","title":"Progressive growing of gans for improved quality, stability, and variation,","venue":null,"work_id":"0a65d054-ef97-48c2-80eb-5a1472c8b59e","year":2018},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:02.990587Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:c1a1d6f6df272f5d097665fb7950fdd6a99a5fa0cbd54f246b803fdf07724aa8","observation_id":"bbccaa72-c661-4b23-8a95-7325dcaa7de9","resolution":{"observed_at":"2026-08-06T19:58:07.885775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:03.146784Z","title":"Unpaired image-to-image translation using cycle-consistent adversarial networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.146784Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:9bd01b44131d2aedcd906831a8ae02632a93da362c5dac98add92087871c7420","observation_id":"f15cd496-2cbc-41f8-b3a0-33f4a0c5b42d","resolution":{"observed_at":"2026-08-06T19:58:03.146784Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.34050","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:06.760128Z","title":"Wrapped phase denoising using denoising diffusion probabilistic models,","venue":null,"work_id":"a774bb44-8cf8-4157-963f-bf88e2d9d448","year":2024},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.245760Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:137da497297a26b058dc294a11eedbec4d061eaf44541f54c56b6d728d23019c","observation_id":"0a9ed52f-6c7c-4c57-b43b-03abfe0f0bf6","resolution":{"observed_at":"2026-08-06T19:58:07.171960Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2503.18352","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:05.948131Z","title":"Diffusion-4k: Ultra-high-resolution image synthesis with latent diffusion models,","venue":null,"work_id":"0c5d5d48-982e-4015-a4ef-18a96ae6eeb9","year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.368276Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:973e8565e1030704806c98e2d1f87aa7c21aa3ef4c8971ee266a5656558f3549","observation_id":"4a3db813-1076-4c35-9802-5e7b85d283d0","resolution":{"observed_at":"2026-08-06T19:58:06.084601Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:03.546204Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.546204Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:f7b776133cd7d3803ecf7103fb2b6d9e631de90999c87ce5c3b46b0e01a42a9c","observation_id":"84253ed0-da30-4925-a238-d56d8b0b0521","resolution":{"observed_at":"2026-08-06T19:58:03.546204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:03.698375Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.698375Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:5ef41e1173b69d67df02cada13b0951dc6d469ed0f51446afef78242655a0df2","observation_id":"978225b2-86ff-4309-a5d0-29f1faac460e","resolution":{"observed_at":"2026-08-06T19:58:03.698375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:03.794578Z","title":"Improving cross-modal alignment for text- guided image inpainting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.794578Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:9c0d27ce1738914c217517136f15870ac7c72e6a8aed3e8f2d669ea92be1a55f","observation_id":"5e74baa5-ad98-4b2e-ab48-5e18f78c046c","resolution":{"observed_at":"2026-08-06T19:58:03.794578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01377","last_updated":"2025-06-02T09:56:36Z","snapshot_observed_at":"2026-08-06T08:18:28.668841Z","submitted_at":"2025-01-02T17:37:20Z","title":"Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01377","snapshot_observed_at":"2026-08-06T19:58:03.938240Z","title":"Training medical large vision- language models with abnormal-aware feedback,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:03.938240Z"},"links":{"cited_paper":"/paper/2501.01377","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:f2f7fb5c408aec372fccf65ac34c8334f892f0fbbc3f5e1c4f37cb3fa880dd7c","observation_id":"1ed7a406-62f0-4de9-8b3a-a1ee0a56717b","resolution":{"observed_at":"2026-08-06T19:58:03.938240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:04.039751Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.039751Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:9ab4b273711f74043b783e5a8e88bdbfcf7aafb33c288ccc834768d72d23bee4","observation_id":"499d3422-1ebd-486c-bcdf-e5d7068012e7","resolution":{"observed_at":"2026-08-06T19:58:04.039751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-06T19:58:04.104937Z","title":"Visualbert: A simple and performant baseline for vision and language,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.104937Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:f84a3f586fc789a822b153f4d21a4967ada723598af4d577a54ab69f5bef9213","observation_id":"7e7b9a1f-e213-48e4-9b90-8a219cd8f120","resolution":{"observed_at":"2026-08-06T19:58:04.104937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:04.146702Z","title":"LXMERT: learning cross-modality encoder representations from transformers,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.146702Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:e1cfd7154d9a2e8d263b29b4f97e7281c96c32a23619d19c062bf8e95ff827e3","observation_id":"5e8eeb73-a962-4392-b228-2bb6c6c2f836","resolution":{"observed_at":"2026-08-06T19:58:04.146702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:04.269413Z","title":"UNITER: universal image-text representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.269413Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:aa4b61ef361ad2b00312b01ad2a3e3a2202eb38eb3556765fd40bfb8f943f5e8","observation_id":"e7c31312-2bd0-45e9-9f18-a46deaa6b514","resolution":{"observed_at":"2026-08-06T19:58:04.269413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:07.654286Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"aab49435-9d02-49b2-b4d9-cb20f230035d","year":2021},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.467187Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:3939bb5746adae4ea62edb1289c20f0e8802c98aee06eea552417202c6ee9dea","observation_id":"c15234cd-319a-4739-9e93-7817ad3283c1","resolution":{"observed_at":"2026-08-06T19:58:07.749125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:04.673194Z","title":"Interleave-vla: Enhancing robot manipulation with interleaved image-text instructions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.673194Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:f529117c5db0db05fbb21ba6db686087895472728ec0529b883dbb5e6aa868fd","observation_id":"99bd6c51-ee5f-4d94-bb95-730fa9ffb1ea","resolution":{"observed_at":"2026-08-06T19:58:04.673194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03963","last_updated":"2024-06-14T03:42:17Z","snapshot_observed_at":"2026-07-06T14:02:32.637793Z","submitted_at":"2022-10-08T08:07:47Z","title":"SDA: Simple Discrete Augmentation for Contrastive Sentence Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03963","snapshot_observed_at":"2026-08-06T19:58:04.807213Z","title":"Sda: simple discrete augmentation for contrastive sentence representation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.807213Z"},"links":{"cited_paper":"/paper/2210.03963","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:6ae846a46f6d3b9fbef061c2283901eb61a81d150b0b6d0792f361541a54ca3f","observation_id":"a18d5673-de44-4be3-89d3-fd2fed68f536","resolution":{"observed_at":"2026-08-06T19:58:04.807213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-06T19:58:04.995920Z","title":"Florence: A new foundation model for computer vision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:04.995920Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:c3c315e118a071b0bc5d4c613b49cb8baca2871713c0e90e8a9ef34e58a1c9a0","observation_id":"6c414907-a55c-4a80-ac8b-b0d78fc63b9c","resolution":{"observed_at":"2026-08-06T19:58:04.995920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:07.536563Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":"eed53e51-8eae-46d7-9af6-07aa6e4f5d70","year":2022},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:05.142667Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:ae598a3df571e1368723e3e588a8dcae1dfdd1bd19d7e0c35cbb565002ec14d9","observation_id":"1d874a5a-7bf3-4e04-870c-719f23f40135","resolution":{"observed_at":"2026-08-06T19:58:07.569594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:58:05.327150Z","title":"Tx-llava: Large language and vision assistant for temporal changes in chest x-rays,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:05.327150Z"},"links":{"citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:e438803c34b7be54320126ab9c68b19f7a072d42959a50ec5d3ae317822bc681","observation_id":"f190b315-f376-478c-b7ee-7d3a5aa52a98","resolution":{"observed_at":"2026-08-06T19:58:05.327150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T19:58:05.420033Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:05.420033Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:5129fa35fa6e38c0e78c17b1ee1f521eb4c77d43ca97fd9ee9e1203e58ee0834","observation_id":"607f8bea-edfd-4106-a2e5-7259d5e0d65f","resolution":{"observed_at":"2026-08-06T19:58:05.420033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07398","last_updated":"2024-06-20T14:44:14Z","snapshot_observed_at":"2026-07-06T17:28:43.842260Z","submitted_at":"2024-02-12T04:13:16Z","title":"VisLingInstruct: Elevating Zero-Shot Learning in Multi-Modal Language Models with Autonomous Instruction Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07398","snapshot_observed_at":"2026-08-06T19:58:05.562611Z","title":"Vislinginstruct: Elevating zero-shot learning in multi-modal lan- guage models with autonomous instruction optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:05.562611Z"},"links":{"cited_paper":"/paper/2402.07398","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:0bc3e1ca638dc338908dd2fb95d4a7817273b56df1dc3484444ccf53b86bd151","observation_id":"db4e1c6d-90c6-4b13-a17c-7e5d6f8bdaad","resolution":{"observed_at":"2026-08-06T19:58:05.562611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19835","last_updated":"2025-06-24T17:52:43Z","snapshot_observed_at":"2026-08-06T22:59:26.083658Z","submitted_at":"2025-06-24T17:52:43Z","title":"MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaboration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19835","snapshot_observed_at":"2026-08-06T19:58:05.710909Z","title":"Mam: Modular multi-agent framework for multi-modal medical diagnosis via role-specialized collaboration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:58:05.710909Z"},"links":{"cited_paper":"/paper/2506.19835","citing_paper":"/paper/2507.04152"},"observation_digest":"sha256:a83178ae4562d27399f821088e791ecb3d4efc34dec8f4257934dd966a0b660a","observation_id":"682ff5f4-01e0-4636-a69f-8cffd40bb5fe","resolution":{"observed_at":"2026-08-06T19:58:05.710909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04152","last_updated":"2025-07-05T20:21:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:51:20.857836Z","submitted_at":"2025-07-05T20:21:03Z","title":"LVLM-Composer's Explicit Planning for Image Generation"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":22,"verified_exact":3,"verified_fuzzy":4},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2507.04152."}