{"as_of":"2026-08-08T02:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f693a2a2578c34929485b4a8a0435c53ee74d2da102d6c09956e69aef6a19a8","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:01:50.856287Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04151/citation-record","integrity":"/paper/2507.04151/integrity","json":"/paper/2507.04151/citation-record.json","paper":"/paper/2507.04151"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-08-07T15:30:21.145991Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24787","snapshot_observed_at":"2026-08-06T20:01:48.603688Z","title":"Draw all your imagine: A holistic benchmark and agent framework for complex instruction-based image generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.603688Z"},"links":{"cited_paper":"/paper/2505.24787","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:3c705594bcf44ea6b5a824c9e7267ed01d86bfbd6a6f7acb238cf9b19f3995d7","observation_id":"36ea33ba-720d-4b0d-a522-6a82941ee6aa","resolution":{"observed_at":"2026-08-06T20:01:48.603688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:48.681445Z","title":"Score: Story coherence and retrieval enhancement for ai narratives,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.681445Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:28e49f223c6c3d645987a754eef55d9e88ffd7c64a52ec642aa7aaa67bccac59","observation_id":"c0237661-a292-42e9-b8b0-f7c521d28f7a","resolution":{"observed_at":"2026-08-06T20:01:48.681445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20367","last_updated":"2025-08-07T08:34:03Z","snapshot_observed_at":"2026-08-01T21:54:39.941118Z","submitted_at":"2024-12-29T06:15:41Z","title":"Enhancing Code LLMs with Reinforcement Learning in Code Generation: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20367","snapshot_observed_at":"2026-08-06T20:01:48.736481Z","title":"Enhancing code llms with reinforcement learning in code generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.736481Z"},"links":{"cited_paper":"/paper/2412.20367","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:b5eabdbfbbe6411c31d261a4f458f0af52c75c589f0743222d9ee3ad52925339","observation_id":"712b153c-1902-48dc-9661-2acf37a83993","resolution":{"observed_at":"2026-08-06T20:01:48.736481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:52.018654Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":"f92f6a78-3dfc-4334-b131-ef7e3fcd4d71","year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.799947Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:ddc2a58ca7e852c9d0d017e80e78b360f727d30e9ec3c872fde2aa532851310a","observation_id":"471daa47-9b5e-439c-9265-31438a124170","resolution":{"observed_at":"2026-08-06T20:01:52.022091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:52.008856Z","title":"Triple sequence generative adversarial nets for unsupervised image captioning,","venue":null,"work_id":"2195a10c-94e0-4431-a6fc-b3a190bf2b72","year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.852793Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:a6ff4b874d1607e7303c9bb7aec2f19551b267f946ea58fb46574ce143dc3392","observation_id":"c1544d88-8c49-4e86-89c5-bce1d492e2cb","resolution":{"observed_at":"2026-08-06T20:01:52.012625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:48.915151Z","title":"Visual in-context learning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.915151Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:ab8e7c5eb34e34c749419df89733a79a84f949f714ca3fe2b2277b70a979696f","observation_id":"0380e3cc-e4dd-4c90-8ed4-29e8044e2766","resolution":{"observed_at":"2026-08-06T20:01:48.915151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:48.968028Z","title":"Weak to strong generalization for large language models with multi-capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:48.968028Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:b00e2006de2245a5355aef9532fd56f339f14b0d39d5e62101d774694d83701a","observation_id":"5f51352c-1325-4fa7-8205-16168498195e","resolution":{"observed_at":"2026-08-06T20:01:48.968028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01377","last_updated":"2025-06-02T09:56:36Z","snapshot_observed_at":"2026-08-06T08:18:28.668841Z","submitted_at":"2025-01-02T17:37:20Z","title":"Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01377","snapshot_observed_at":"2026-08-06T20:01:49.027115Z","title":"Training medical large vision- language models with abnormal-aware feedback,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.027115Z"},"links":{"cited_paper":"/paper/2501.01377","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:4e7a626f0eb0309c7a7518c37f866bf412ff092c0c10308b0cfef41888bc5007","observation_id":"7c2e7e97-51ae-48d3-89ca-cb45602dea6d","resolution":{"observed_at":"2026-08-06T20:01:49.027115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T20:01:49.072704Z","title":"LAION-400M: open dataset of clip-filtered 400 million image-text pairs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.072704Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:d039cf7599268addd9c5f343f604de146f6a33c3d01debef78a7c95eab2cca35","observation_id":"e769d58f-c0b2-436b-b2a5-4884d2b33751","resolution":{"observed_at":"2026-08-06T20:01:49.072704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.124936Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image cap- tioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.124936Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:af8f49500cd5cab9764e988d8fd27129dbc1369b75902716b99a894afd5d0929","observation_id":"a64bd966-0714-446e-baf7-df3e2de89e81","resolution":{"observed_at":"2026-08-06T20:01:49.124936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.182156Z","title":"Microsoft COCO: common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.182156Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:e7d99041989170282f9b1a19db7f97738d6f1b595a123de289cd114ebad81408","observation_id":"3e983ef3-f2c4-4479-84e6-ed3e42306a8d","resolution":{"observed_at":"2026-08-06T20:01:49.182156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.238458Z","title":"Beyond empathy: Integrating diagnostic and therapeutic reasoning with large language models for mental health counseling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.238458Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:7f249acac2f1f6678778cb9e775fe8b2ec2e628ad4fad76ce5e2a441ba279d26","observation_id":"b51647f4-05da-472d-8aa9-a3e55bbafaea","resolution":{"observed_at":"2026-08-06T20:01:49.238458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.984888Z","title":"Multimodal event transformer for image-guided story ending generation,","venue":null,"work_id":"b6cc9ed1-7565-4396-a2cc-bf43803829e7","year":2023},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.291914Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:b6ea99ed23b61f2d924d976e762519ae1e9eb23aecae4d20d7daeadf9a31f587","observation_id":"c4bb82b5-5d46-4de5-a61e-31fa8521f3f0","resolution":{"observed_at":"2026-08-06T20:01:51.987595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.976575Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"aca53972-1ced-4f10-8dea-5c11298d7547","year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.346212Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:c4c19e968068f8ed886ac46d977596d7e3b7f123cbe8ff4e2de54e3437ca9421","observation_id":"52b8e76b-5685-4a07-9ed3-d7699c55c7d8","resolution":{"observed_at":"2026-08-06T20:01:51.979779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.415102Z","title":"Language models with image descriptors are strong few- shot video-language learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.415102Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:a7705b275979a25fd87f53aefc17748ffbd212563ae46b7810e9becca5eb3215","observation_id":"303dce78-eb93-4e1d-af3f-46553e5732e9","resolution":{"observed_at":"2026-08-06T20:01:49.415102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.477464Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.477464Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:09a8b2901e217e02cc84b9c920c851817a7769bbde21dd8d4f89229e898ec3aa","observation_id":"e2b9ee77-6052-4fa3-a5ca-aa9cdc7d36a8","resolution":{"observed_at":"2026-08-06T20:01:49.477464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.537759Z","title":"BLIP: bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.537759Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:d34ea80acc02b6f053abbf3418345075f2b5b12ad0725f104f3ca0b68c8b2ae4","observation_id":"f6b2fe0d-0c95-403f-b6f8-29463105be68","resolution":{"observed_at":"2026-08-06T20:01:49.537759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.947729Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"5a8009c4-0439-4be7-b139-344118c0f501","year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.665137Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:a599ec76176a3ad98cff3fd571a8cca586f8373b4457866fe57ab59245381881","observation_id":"11c69b06-b6ac-46c8-b741-6f2949ee603e","resolution":{"observed_at":"2026-08-06T20:01:51.950631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.930961Z","title":"Cross-lingual transfer of large language model by visually- derived supervision toward low-resource languages,","venue":null,"work_id":"7c922bb0-36fc-41d8-8394-69e86b2da831","year":2023},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.777370Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:b8c2a583db584c331d790d87b0c69c0db9826965a740fe0fbae5b7ec129a8e7d","observation_id":"c8d1758d-90c1-4e67-b954-f884343bde56","resolution":{"observed_at":"2026-08-06T20:01:51.933684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.857465Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.857465Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:1b5280a2f06266d8d55e7e54bb3ddfe38d0fa8ac0673160b8c873b1dd0beb374","observation_id":"bbb1fff5-f82a-4315-a287-ce1fe51623f6","resolution":{"observed_at":"2026-08-06T20:01:49.857465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.932790Z","title":"Tx-llava: Large language and vision assistant for temporal changes in chest x-rays,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.932790Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:03386ac5333ae612de255939d5c65c5b50c1e587068222d5b96f9168dc27698c","observation_id":"8a8f4c49-5753-4a90-8d2b-349c24d96839","resolution":{"observed_at":"2026-08-06T20:01:49.932790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19835","last_updated":"2025-06-24T17:52:43Z","snapshot_observed_at":"2026-08-06T22:59:26.083658Z","submitted_at":"2025-06-24T17:52:43Z","title":"MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaboration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19835","snapshot_observed_at":"2026-08-06T20:01:49.990147Z","title":"Mam: Modular multi-agent framework for multi-modal medical diagnosis via role-specialized collaboration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.990147Z"},"links":{"cited_paper":"/paper/2506.19835","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:324d7b59819687cc84e3292a8729441d2d32d641fb909c908c0f2ae7076871d8","observation_id":"c0f02167-b11d-450b-84ee-efd249df8742","resolution":{"observed_at":"2026-08-06T20:01:49.990147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.916251Z","title":"GLIDE: towards photorealistic image generation and editing with text-guided diffusion models,","venue":null,"work_id":"13cdebf5-d646-4c52-8c52-84446c92643d","year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.130327Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:b0df74364d2de5f684eaf4faf33d2077e8168c99a6b26b43a613fc8e0140b1aa","observation_id":"862c957f-faa2-484a-8d51-e71cc023b4db","resolution":{"observed_at":"2026-08-06T20:01:51.919344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.907783Z","title":"Taming transformers for high-resolution image synthesis,","venue":null,"work_id":"94e6833d-dfc0-463b-bc87-845ef785d88c","year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.236512Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:091d14a99bdbeea5c0e5cfd8a60a85cc6defa9c88f8d481d7f3339e3665a131d","observation_id":"297a636c-188f-4afa-b695-eec47deb6d44","resolution":{"observed_at":"2026-08-06T20:01:51.910644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T20:01:50.429219Z","title":"Hierarchical text-conditional image generation with CLIP latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.429219Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:d57c2b1786aa34d88812de95511a1bda391bb940c1e3c96c0159e6f731f38f88","observation_id":"58fbf2b1-988a-45fb-aa34-34272b0e1b4e","resolution":{"observed_at":"2026-08-06T20:01:50.429219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.721707Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"818cb7bd-0562-4266-8837-002d6f0c995d","year":2023},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.532097Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:c0e0c478430d2be99298e772eb1e97aec8b1af66fc9254e99e10f5047a4dc74b","observation_id":"c9bfb984-33e0-4f54-a912-407aa9600c49","resolution":{"observed_at":"2026-08-06T20:01:51.891777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.16763","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.071418Z","title":"Self-rewarding large vision- language models for optimizing prompts in text-to-image generation,","venue":null,"work_id":"33262bf4-3d36-4f26-ae42-bfb4832c9d1f","year":2025},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.623402Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:c44723f18f53197f7cc1bc2e43ec08931849611239c48bfbcf491802c82def2b","observation_id":"23f68944-0b40-4f1c-8bc8-6956db206c4c","resolution":{"observed_at":"2026-08-06T20:01:51.120901Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.526445Z","title":"Evolvedirector: Approaching advanced text-to-image generation with large vision- language models,","venue":null,"work_id":"8121b739-4881-49f9-af16-22d1613650e0","year":2024},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.782997Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:32b47cafc311b5fcbeea32b47da80568df8fcc57a34d148e55c6275fa0e79212","observation_id":"a03b9272-b4da-457a-93c2-b024dea37138","resolution":{"observed_at":"2026-08-06T20:01:51.618270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06311","last_updated":"2023-10-10T05:09:05Z","snapshot_observed_at":"2026-08-04T12:46:20.982579Z","submitted_at":"2023-10-10T05:09:05Z","title":"Improving Compositional Text-to-image Generation with Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06311","snapshot_observed_at":"2026-08-06T20:01:50.856287Z","title":"Improving compositional text-to-image generation with large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.856287Z"},"links":{"cited_paper":"/paper/2310.06311","citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:bd3ad4dbba3fe0004d71b6e9e47fe769ad56252f3c38ac28d14fc950942bce23","observation_id":"d773c6ae-7ce0-4acc-90e3-fc520c889a19","resolution":{"observed_at":"2026-08-06T20:01:50.856287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:49.603500Z","title":"12 888–12 900","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":162,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.603500Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:41bf1e29bcb5f47e83f03d1289d4f88725decfbdb555699d2b64b31a4ac54cc9","observation_id":"ce90422c-0cd8-4b94-aee9-40bbe469c126","resolution":{"observed_at":"2026-08-06T20:01:49.603500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.898228Z","title":"12 873–12 883","venue":null,"work_id":"457dd389-0c84-44d5-b5b6-9e5396b4ac4a","year":2021},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:50.329073Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:0659f70ceccf909a7f540c851d2761f6276bd6091dd03c7e4e38db0c51628b18","observation_id":"36bc1f5d-8b4d-4268-81a7-3680fabc8de5","resolution":{"observed_at":"2026-08-06T20:01:51.901437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:51.939641Z","title":"Available: http://papers.nips.cc/paper\\ files/paper/2022/ hash/960a172bc7fbf0177ccccbb411a7d800-Abstract-Conference.html 11","venue":null,"work_id":"984d36f9-5d72-452f-9a1f-1e17d9910e92","year":2022},"citing_paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:49.714980Z"},"links":{"citing_paper":"/paper/2507.04151"},"observation_digest":"sha256:22c021900c1a7d2e37e40d5b1fca9ee647e873fd57a28bbfb1bf0189aec760a5","observation_id":"e42b8339-0647-416f-ab6f-96e8422d85ea","resolution":{"observed_at":"2026-08-06T20:01:51.942532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04151","last_updated":"2025-07-05T20:16:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T15:30:15.415428Z","submitted_at":"2025-07-05T20:16:32Z","title":"Unlocking Compositional Control: Self-Supervision for LVLM-Based Image Generation"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2507.04151."}