{"as_of":"2026-08-07T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d48dbef426c92b77ac32b236e7bbd7be625c50bfa6712d8b666bc546a0b4adef","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:50:21.910265Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:11:10.598413Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:11:02.341076Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"cited_work":{"arxiv_id":"2507.05300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05300","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fed020c3-36d6-49cb-b52c-7bf04df6df78","year":2025},"citing_paper":{"arxiv_id":"2604.12357","last_updated":"2026-04-14T06:47:47Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T06:47:47Z","title":"ReflectCAP: Detailed Image Captioning with Reflective Memory","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T16:11:10.598413Z"},"links":{"cited_paper":"/paper/2507.05300","citing_paper":"/paper/2604.12357"},"observation_digest":"sha256:5ce35447cbe0ac6589141e5a19bbf692f5620f7299e81c95b001a90645d8307d","observation_id":"d7a5f4ea-e055-4ebe-8ff9-309d4390ee0a","resolution":{"observed_at":"2026-05-11T09:11:02.344304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.05300/citation-record","integrity":"/paper/2507.05300/integrity","json":"/paper/2507.05300/citation-record.json","paper":"/paper/2507.05300"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.20088","last_updated":"2023-10-28T08:46:13Z","snapshot_observed_at":"2026-08-05T05:10:35.003635Z","submitted_at":"2023-05-31T17:59:04Z","title":"Improving CLIP Training with Language Rewrites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20088","snapshot_observed_at":"2026-08-06T19:50:20.447559Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.447559Z"},"links":{"cited_paper":"/paper/2305.20088","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:7cd433c2b9f25f5d8611ed504193ea020616f4f7a9060f8d578b44999921f97b","observation_id":"f885d8ca-7074-4cd9-913c-7f22f0cab520","resolution":{"observed_at":"2026-08-06T19:50:20.447559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T19:50:20.713255Z","title":"Lai, Z., Zhang, H., Zhang, B., Wu, W., Bai, H., Tim- ofeev, A., Du, X., Gan, Z., Shan, J., Chuah, C.-N., Yang, Y ., and Cao, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.713255Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:b54868f502366ed68c363bdfb121db052ef6a8f7295a6e7088c9ce24419db0cc","observation_id":"88973b45-3c6a-4501-b3b5-3226af531b7e","resolution":{"observed_at":"2026-08-06T19:50:20.713255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07699","last_updated":"2024-03-13T22:27:08Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:49:13Z","title":"VeCLIP: Improving CLIP Training via Visual-enriched Captions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07699","snapshot_observed_at":"2026-08-06T19:50:20.826610Z","title":"Li, H., Xu, M., Zhan, Y ., Mu, S., Li, J., Cheng, K., Chen, Y ., Chen, T., Ye, M., Wang, J., and Zhu, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.826610Z"},"links":{"cited_paper":"/paper/2310.07699","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:435f2ee3bd12ecfceff9f96031aeefd811939a56f4d027e6356d8367ab994033","observation_id":"94b48528-2d7f-4432-b992-52d9ef528a87","resolution":{"observed_at":"2026-08-06T19:50:20.826610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-06T19:50:21.065213Z","title":"Liao, M., Wan, Z., Yao, C., Chen, K., and Bai, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.065213Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:1d0409de579d0aa09c8b5a30bff624af9929d5e5e317f51dc6e9b5e2277c2973","observation_id":"1e30366c-0674-43ef-9b1e-88fd609466fe","resolution":{"observed_at":"2026-08-06T19:50:21.065213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T19:50:21.319649Z","title":"Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y ., Li, W., and Liu, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.319649Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:1511831b852b15428b31ab79dc98293126be091b983bb7f1f30fb62a176df207","observation_id":"566015e5-ed23-4701-8800-34684a5e14bf","resolution":{"observed_at":"2026-08-06T19:50:21.319649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-06T19:50:21.432622Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.432622Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:a3d017e6272ab92878f1e9f1d42d52e6f4e84f6f7d6f4117ddbcd6c4f18eb03c","observation_id":"340f21b8-295a-4eb3-abc5-e0e6b53459fc","resolution":{"observed_at":"2026-08-06T19:50:21.432622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-06T19:50:21.587329Z","title":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., and Ommer, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.587329Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:c322ecd909f3324fe0612c65f0f6cc5eb8796c672d5cee8ea327adee25f5bdc4","observation_id":"3b8c973b-ba5c-4166-9c49-159b4e9bd0fa","resolution":{"observed_at":"2026-08-06T19:50:21.587329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-06T19:50:21.722260Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.722260Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:e29420c921904327501dd1ad4b613fdf80df4b783997aec69e0443a10ac063f9","observation_id":"684798eb-30d9-4e21-aa95-74aebaaf8576","resolution":{"observed_at":"2026-08-06T19:50:21.722260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-06T19:50:21.801084Z","title":"Webster, R., Rabin, J., Simon, L., and Jurie, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.801084Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:4ef113e1b73e1a2678041dc266f491c61a210cb304143fd12bb507b2542740d8","observation_id":"3f51bf79-9eea-43ce-8bfd-cd8cdc3a2d0a","resolution":{"observed_at":"2026-08-06T19:50:21.801084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12733","last_updated":"2023-03-17T17:39:06Z","snapshot_observed_at":"2026-07-06T15:06:45.725032Z","submitted_at":"2023-03-17T17:39:06Z","title":"On the De-duplication of LAION-2B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12733","snapshot_observed_at":"2026-08-06T19:50:21.910265Z","title":"org/abs/2303.12733","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.910265Z"},"links":{"cited_paper":"/paper/2303.12733","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:56e173bc4ff4b7b5e53f6ecfa4863201ed94a57b3f00e1d2b82ebc481579ebd3","observation_id":"af231c98-e5aa-41da-ad64-83e123ae1795","resolution":{"observed_at":"2026-08-06T19:50:21.910265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08947","last_updated":"2019-12-03T13:33:45Z","snapshot_observed_at":"2026-07-06T08:38:30.571080Z","submitted_at":"2019-11-20T14:56:47Z","title":"Real-time Scene Text Detection with Differentiable Binarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08947","snapshot_observed_at":"2026-08-06T19:50:21.181128Z","title":"Liu, H., Li, C., Li, Y ., and Lee, Y","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.181128Z"},"links":{"cited_paper":"/paper/1911.08947","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:e17f9a40774114ac15ca053c7d288fb07a465c3f233b74023d2ae16d6db120d9","observation_id":"fc42e81c-c4a3-41ff-8b16-3565f1968b45","resolution":{"observed_at":"2026-08-06T19:50:21.181128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T19:50:20.584536Z","title":"org/abs/2106.09685","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.584536Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:a4a8700908f3a49ca4c436f66797a3f960417f9ea6194c78228ca8a913f739f2","observation_id":"b6a03b2e-96aa-4486-9572-0259eed5175a","resolution":{"observed_at":"2026-08-06T19:50:20.584536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-06T19:50:20.256972Z","title":"Dai, W., Li, J., Li, D., Tiong, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.256972Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:d73f1052347044a3ef63466e4ebb515f310d1b5a373187bad1689d199b736186","observation_id":"3a50c2c2-4980-4c10-90f7-7c0efca2df78","resolution":{"observed_at":"2026-08-06T19:50:20.256972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T19:50:20.352206Z","title":"Fan, L., Krishnan, D., Isola, P., Katabi, D., and Tian, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.352206Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:9fffee355c2ffaf31e3ae0aa5a5406b5ddd007a586a7bcc3100e7f01d8b6eb12","observation_id":"09560a62-a540-4de7-8c60-a833ec3d9a4d","resolution":{"observed_at":"2026-08-06T19:50:20.352206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T19:50:20.126209Z","title":"Chung, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.126209Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:fe2df56c7f3c764c067e3dd333f3358d6decc3d2d646384f3ea5ed337fafe134","observation_id":"7a5cdab3-5c44-4c2d-857f-bdbbecbb83dc","resolution":{"observed_at":"2026-08-06T19:50:20.126209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00115","last_updated":"2025-01-04T06:16:56Z","snapshot_observed_at":"2026-07-06T19:59:11.046948Z","submitted_at":"2024-11-28T07:01:06Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00115","snapshot_observed_at":"2026-08-06T19:50:20.935002Z","title":"org/abs/2412.00115","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.935002Z"},"links":{"cited_paper":"/paper/2412.00115","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:2f28f13422e583648d8177d0c5beab093745c1e9d53eabc7f4b1f637a5e0770a","observation_id":"b5091e9e-6cf9-443f-b523-f03b45dbf721","resolution":{"observed_at":"2026-08-06T19:50:20.935002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 1 inbound Pith citation observation for arXiv:2507.05300."}