{"as_of":"2026-08-07T09:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd5f99064bef462eedc05bccd630f47b814cbf743ec92528c221b68ecd1765d5","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:59:15.664441Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.01008/citation-record","integrity":"/paper/2508.01008/integrity","json":"/paper/2508.01008/citation-record.json","paper":"/paper/2508.01008"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T05:59:15.447253Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.447253Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:84013004a217d50fd364e6998bca721f25aff5fae1fcd0a02229e94f67a1b77e","observation_id":"77de1c1f-5091-4938-912a-95ea6d7ab884","resolution":{"observed_at":"2026-08-06T05:59:15.447253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.253097Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation, 2023","venue":null,"work_id":"825980f3-4e79-4604-b112-10ded93847c1","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.452642Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:d4f6e7a37b0ec98bc44cf3329b7c759b939b5c08ec8992fcbd0f3d040c4505d1","observation_id":"f33e43e0-5ac2-4c4c-8846-dc8f5da62df4","resolution":{"observed_at":"2026-08-06T05:59:16.257836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.242018Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":"bb8026e8-2037-464b-8453-3c5d9a753fd1","year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.456356Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:6abc895c057c8c87d5fa7f1586b1672165718cf4ce51089e32b1c08118cb2eb8","observation_id":"ef88c5b7-ba2f-4644-8814-2ded100596c5","resolution":{"observed_at":"2026-08-06T05:59:16.246018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-06T05:59:15.459932Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.459932Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:06a5421476aafeac1b53345b5c563361854cbc2abe617add7acb64faeedab7f3","observation_id":"3e6b6bcd-aa20-4a8d-b405-71ccf698ba34","resolution":{"observed_at":"2026-08-06T05:59:15.459932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T05:59:15.463874Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.463874Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:9ee1df6dda9beea6d60b04f26df910451c3d9464fe5f1c38e8cf4864d929a957","observation_id":"7a802e98-d67a-45ec-9e3b-86fedc30fa33","resolution":{"observed_at":"2026-08-06T05:59:15.463874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.231544Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":"c95bc6b5-bf71-470e-b9c3-6de683630bc2","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.468885Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:f968f55f78ee874a9a4a5d18b7a604cba89e4e926590bbef1755f5ef736cd191","observation_id":"a57f74c1-180f-4dfc-b297-6559e7eb33a7","resolution":{"observed_at":"2026-08-06T05:59:16.235144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T05:59:15.472695Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.472695Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:2ea6bd56418570d410d64904c30bed25ae2fed79549980f32eb271a86474aa33","observation_id":"2701598b-bad2-4951-823f-fd574c4888c2","resolution":{"observed_at":"2026-08-06T05:59:15.472695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.220346Z","title":"Yolo-world: Real-time open-vocabulary object detection","venue":null,"work_id":"5c908135-862d-401f-864e-eb9748bd0a2f","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.476994Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:85eb9b78ce5a9ce76abdca12d9169b5c44e9c9d28e99a7dfd6f322da3d0ca142","observation_id":"fff1f503-be48-4288-bdd8-83c895fcb5e5","resolution":{"observed_at":"2026-08-06T05:59:16.224851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.210491Z","title":"Laion pop: 600,000 high-resolution images with detailed descriptions","venue":null,"work_id":"9d2e152a-ebbe-4eeb-9800-f2d06f4359f6","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.480962Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:c648ce91e4c7169ff86b243348f34842ef5ea9e8d936e075bf59714091f9d6b1","observation_id":"7b7cdf4a-83c0-4d7a-b55d-36bb5c69dc3c","resolution":{"observed_at":"2026-08-06T05:59:16.213947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T05:59:15.484280Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.484280Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:d4a1a506008e5c958357af32835ded6a7e29bad3ae5c762bd6bb344cf73b9d47","observation_id":"50095dc7-82b3-46e9-aa8d-9d29971cf9c3","resolution":{"observed_at":"2026-08-06T05:59:15.484280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.199860Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"2e2f57e6-1349-49ec-a0b6-32f68fe36dcd","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.488421Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:3b30637c7378be5ae3652a4326b32692782792bdc2ff2ecf3b7d7ef8e6e7077b","observation_id":"9438a0ce-ce74-4342-978f-57d03d86a504","resolution":{"observed_at":"2026-08-06T05:59:16.203931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.189870Z","title":"Ranni: Taming text-to-image diffu- sion for accurate instruction following","venue":null,"work_id":"8fe90b3f-6fdb-450a-8102-1d5a0a4152c0","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.491661Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:340e7227ded6e14d9f0b78cf743327d39c5f34b6b13d0aca37214e786032890f","observation_id":"93e15a82-0e6c-4825-9092-8b0da2d411f8","resolution":{"observed_at":"2026-08-06T05:59:16.193135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02793","last_updated":"2024-10-28T21:15:36Z","snapshot_observed_at":"2026-08-02T05:25:18.174400Z","submitted_at":"2024-05-05T02:15:11Z","title":"ImageInWords: Unlocking Hyper-Detailed Image Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02793","snapshot_observed_at":"2026-08-06T05:59:15.495125Z","title":"Im- ageinwords: Unlocking hyper-detailed image descriptions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.495125Z"},"links":{"cited_paper":"/paper/2405.02793","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:d493550cfd7321290621f8dbe911aa1b4a4088a66c5ede32298bad99750426b9","observation_id":"e6dc0a98-1f1e-4dd8-af7e-2e8d392853db","resolution":{"observed_at":"2026-08-06T05:59:15.495125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-06T05:59:15.498764Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.498764Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:b80264944f8bf117699385c268947a6d55f5212b401d83ce72de223010c5958f","observation_id":"5a4d026d-e51f-4c69-a263-2353e07f88ec","resolution":{"observed_at":"2026-08-06T05:59:15.498764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.502311Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.502311Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:05a8157e2488e69dfcc5afbe5190f6e06ce56465d013796f84901484927567cd","observation_id":"ec4ef736-a22c-4e54-80d8-2e2fcf0e8f87","resolution":{"observed_at":"2026-08-06T05:59:15.502311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T05:59:15.505850Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.505850Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:a953a4b63ca2ee452be89b8dc84f2acab01d023867725a512b18ced0aa23f0d6","observation_id":"9d6ebf94-b546-4cf6-a2f0-048608780046","resolution":{"observed_at":"2026-08-06T05:59:15.505850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.173772Z","title":"LVIS: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"b0b14243-e802-411c-8846-aab10ce69b4b","year":2019},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.509041Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:fbf2da1cf3062dfa9c1e4b317ef32bec0f743fc5151d92d6b540b02c6d444d59","observation_id":"a68c98e0-5d59-45c3-bc17-f5f3da9c8edc","resolution":{"observed_at":"2026-08-06T05:59:16.177516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.163606Z","title":"Retrieval-augmented open-vocabulary object detec- tion","venue":null,"work_id":"5c0269d4-1c71-4a78-ab21-fe6ca3bc0952","year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.512266Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:e5cae949f8de498d03197f79145c5f4850b3da79e5359ed12953259f13d39484","observation_id":"2e451c29-f81e-4700-93a1-111666ef7e24","resolution":{"observed_at":"2026-08-06T05:59:16.167216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.153464Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":"3e008309-b7e9-41ec-9450-2d1af294fe33","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.515883Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:99ebf8d05ba322658307d1645ea8706a76abaff918dec2435aba1ed0e936a95f","observation_id":"56937916-9015-48ff-8881-f86b7f20af56","resolution":{"observed_at":"2026-08-06T05:59:16.157206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.142503Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"ae82edcc-4ba7-4fc6-8e16-79b6c0cd1ef1","year":1956},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.519045Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:4005dbd51527d3a9137cec9fda4e6b46ea6022e95d7b84bb05b6765f9bb02df1","observation_id":"9f95e6be-3bc2-4573-a786-0fcd6d081036","resolution":{"observed_at":"2026-08-06T05:59:16.146463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.132658Z","title":null,"venue":null,"work_id":"e9d13348-d8e3-48f1-8efd-94f5e0d4e646","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.522276Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:d24a2a4ac6bf109b88fe051ec7682f449b5a4e76d4c030aa9f38b6cc675da950","observation_id":"464d037d-087b-49e0-9697-6f1fcd9db6f0","resolution":{"observed_at":"2026-08-06T05:59:16.136002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.525838Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.525838Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:a404c4dad64bff5f761b104468c9af68de5ef7d23f3edd674fcb1bc22232f22c","observation_id":"d3545566-8d32-40b4-aa70-4d3e0ffd41e4","resolution":{"observed_at":"2026-08-06T05:59:15.525838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.528965Z","title":"Grounded language-image pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.528965Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:c1242946590786f11917765c94c78798cfa6b21640d89b403fdfe24d67be43b6","observation_id":"e6613a77-2f33-4490-a7b4-c1de1d298e74","resolution":{"observed_at":"2026-08-06T05:59:15.528965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-06T05:59:15.532357Z","title":"Autoregressive image generation without vec- tor quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.532357Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:e0d38007dc12c331c81f347c68bc3876f07e5b09d10a59f0b2a9a03f695dbfe7","observation_id":"65e9596d-df25-4270-9e01-7f6ddaa0cb37","resolution":{"observed_at":"2026-08-06T05:59:15.532357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.110818Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"0b24375b-fba6-4b8e-8493-1b0ebfbe8fe5","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.535880Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:8faeb9a4e15906e182403b46c62ad9efbe47f30bf8ba95e7d1b0541c7e692aba","observation_id":"584874c4-b51e-4df2-be1c-ad3ddeaf8f06","resolution":{"observed_at":"2026-08-06T05:59:16.114320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T05:59:15.539301Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.539301Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:e106dcd900368a25c2d8eedba26d8483bdc411c5ace4cc7f25a93c89de40ff7f","observation_id":"0a12d2be-2083-4d49-a18a-e96e4b528ae4","resolution":{"observed_at":"2026-08-06T05:59:15.539301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.100538Z","title":"Lawrence Zitnick","venue":null,"work_id":"7d04880b-f580-4b23-ac87-10ad62bdf530","year":2014},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.543230Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:ac60cb7eda2e936e50db194180ec930886c8a1fc55e1d41b79c921f0bd3b341b","observation_id":"8cef9ff0-f18e-4e6d-8890-d331dedf1ee3","resolution":{"observed_at":"2026-08-06T05:59:16.104144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.549776Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.549776Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:7f10c6bf96c36a22f2dc5991ceef378bfb42cb8a54ba31ceb58ca7675a6eecc5","observation_id":"2972c372-c46f-4923-8e19-7c1e3701b694","resolution":{"observed_at":"2026-08-06T05:59:15.549776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T05:59:15.553172Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.553172Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:5cf3aa140aee083e7d42e2bf7f67e0577e51239e08ec33518922d96c4dcf86c0","observation_id":"799ba3a8-7c66-47d6-a6db-eaa58a0cc94a","resolution":{"observed_at":"2026-08-06T05:59:15.553172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.077109Z","title":"Scaling open-vocabulary object detection","venue":null,"work_id":"dcc1ef74-3c4a-433c-9a7f-e0aa1ec6ce3f","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.556574Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:6665e83994b786e6adb36362f59e03b517db68e0c626ecffe0f222c806d84ff6","observation_id":"798db917-1c23-4eec-abe9-48093b64d801","resolution":{"observed_at":"2026-08-06T05:59:16.081578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19753","last_updated":"2024-04-30T17:56:24Z","snapshot_observed_at":"2026-07-06T18:07:47.744531Z","submitted_at":"2024-04-30T17:56:24Z","title":"DOCCI: Descriptions of Connected and Contrasting Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19753","snapshot_observed_at":"2026-08-06T05:59:15.559791Z","title":"Docci: De- scriptions of connected and contrasting images, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.559791Z"},"links":{"cited_paper":"/paper/2404.19753","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:b43db9f4e92b1f571ce8f164eb7970c96fb1f9ed0f0e276c3336a8a463e196fe","observation_id":"c1b18570-5a77-4e14-9520-86630e70cc47","resolution":{"observed_at":"2026-08-06T05:59:15.559791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.563418Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.563418Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:cd5e108f7d7c0f8b66cf33d3dddab17d4a78b01013e0b6941fa6f0992bc66b08","observation_id":"85db6f9c-64c4-4290-9846-e28f3d23432d","resolution":{"observed_at":"2026-08-06T05:59:15.563418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.567213Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.567213Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:c091679998a5c8b90865d361b5c9ebceb9b59ead004f70cfc4b6a21d5541459b","observation_id":"98b81ee6-cd5e-49ce-9fd9-270e1e435e55","resolution":{"observed_at":"2026-08-06T05:59:15.567213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.055439Z","title":"Grounded text-to-image synthesis with attention refocusing","venue":null,"work_id":"9ba6bda8-db6c-4f49-a45b-55ff4d5ecff5","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.570668Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:be0d96051eeed17b4405435c917bf2ba4b5e06fb1dcb0f3399995b0fb950c59a","observation_id":"1837cca4-5c02-4d3f-8e1d-aaf441661d65","resolution":{"observed_at":"2026-08-06T05:59:16.059036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T05:59:15.573917Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.573917Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:a3d5df1f2c06112e578b075c1d4d47dac639e49d4ef3aa95ec370b70378d4d81","observation_id":"908b97f6-22de-4fb2-afdc-1d8c298085bc","resolution":{"observed_at":"2026-08-06T05:59:15.573917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.07082","last_updated":"2020-04-23T04:22:16Z","snapshot_observed_at":"2026-08-07T01:07:05.571663Z","submitted_at":"2020-03-16T09:05:53Z","title":"Stanza: A Python Natural Language Processing Toolkit for Many Human Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.07082","snapshot_observed_at":"2026-08-06T05:59:15.577307Z","title":"Stanza: A python natural language processing toolkit for many human languages.arXiv preprint arXiv:2003.07082, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.577307Z"},"links":{"cited_paper":"/paper/2003.07082","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:57caa0ea1967c43ef7941e58f46c80f0265a74aabcb2cc894616b98c3df44d56","observation_id":"7024cd76-2a0d-4eac-b776-c3a1ede5c2a1","resolution":{"observed_at":"2026-08-06T05:59:15.577307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.580791Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.580791Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:d10ebfbd45daf0bd43051ad923ba439fd9b5ab96a47eb047094b21da98975a9a","observation_id":"afaf257b-0d06-4304-b251-59a663769a15","resolution":{"observed_at":"2026-08-06T05:59:15.580791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.583942Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.583942Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:e35323c85094b02065009da558e1d6ca2670ba13a12b9c8c2416770c9894b8ca","observation_id":"37938214-507b-4431-8e29-4124034599db","resolution":{"observed_at":"2026-08-06T05:59:15.583942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.033393Z","title":"Stable diffusion v1.4 checkpoint","venue":null,"work_id":"766f3d45-33b8-42e8-a34c-1aa4f3ecf1f9","year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.587044Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:eab12471c125dc413719fc32e01c5ae1bd742398fcaac7cb34ebb54d2acf5f18","observation_id":"b8a4b91e-1cbe-4866-8916-23bf32daaf28","resolution":{"observed_at":"2026-08-06T05:59:16.036870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.022954Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"29ad4127-f130-44bc-b804-9f3c2d6b10aa","year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.590226Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:73b778207ed469d1d8ee09b240f29d3d7eb09e6801203e284a34bdb387897d8d","observation_id":"e9e2b47d-7207-4603-92cc-7fafccf75e71","resolution":{"observed_at":"2026-08-06T05:59:16.026532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:16.013019Z","title":"Laion-aesthetics","venue":null,"work_id":"a3c97109-3904-433c-9c98-412a5238675b","year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.593501Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:6358960140b79150403ce38b3b5d0c57d027351741288f25001777478fbc5cf1","observation_id":"9d4a3a27-5444-48bf-a621-28759a4034b5","resolution":{"observed_at":"2026-08-06T05:59:16.016615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.596983Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.596983Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:7b9dca0350359ed96cd7e6f479c07321e840688856a15220093039aed7a4513e","observation_id":"f4fa66e1-ddd9-4b72-a679-bfe17225964c","resolution":{"observed_at":"2026-08-06T05:59:15.596983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.995537Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"a2e98c30-3b2e-4fa4-9ebc-36cfa19129c3","year":2019},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.600205Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:12fb2320449b607a3ef57101b5864f62771da884eb714849e7bb8483dd306d3c","observation_id":"4d9d324e-7f0f-45f4-b0ec-5ecbacbdd76f","resolution":{"observed_at":"2026-08-06T05:59:15.999193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-06T05:59:15.603444Z","title":"From pixels to prose: A large dataset of dense image cap- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.603444Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:48fa78d9b58b7974f37b0fba12b67f585849b714182f5c01c45f4b8d3d1f1820","observation_id":"ce87387f-6774-4174-adf5-76bfa3e64914","resolution":{"observed_at":"2026-08-06T05:59:15.603444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T05:59:15.607151Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.607151Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:5c21d12bd964532833d544a6d98decf45328555535b8a18538ea20a491cb609f","observation_id":"f2d401de-1157-4434-96b8-28f7dea11fce","resolution":{"observed_at":"2026-08-06T05:59:15.607151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T05:59:15.610644Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.610644Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:7acbbcce6e6a32d9156784d98d6bdb3d7fe4c86ac1917ef6d50ba17467089b4b","observation_id":"38c09d6d-ded2-4e7b-b0ad-e15987f7c9b6","resolution":{"observed_at":"2026-08-06T05:59:15.610644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07844","last_updated":"2024-07-22T03:26:21Z","snapshot_observed_at":"2026-08-05T18:50:42.664160Z","submitted_at":"2024-07-10T17:05:49Z","title":"OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07844","snapshot_observed_at":"2026-08-06T05:59:15.615039Z","title":"Ov-dino: Unified open-vocabulary de- tection with language-aware selective fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.615039Z"},"links":{"cited_paper":"/paper/2407.07844","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:7f2133800722e9891a8c355ebe98f6fa33027e323d8c4f2d0944940688a2f27e","observation_id":"9742e30f-4e89-4261-add6-acde697eeb25","resolution":{"observed_at":"2026-08-06T05:59:15.615039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.985162Z","title":"V3det: Vast vocabulary visual detection dataset","venue":null,"work_id":"e12d6a6b-dc8d-4c6e-af10-3c6b2854a2bb","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.618896Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:7046bbe8f6229bff958291ac0fcd363570d8fd5d6b5134f70d9fc65402d82ea5","observation_id":"6f6a7ee7-658f-4415-8b68-9d49ee5de36f","resolution":{"observed_at":"2026-08-06T05:59:15.988752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T05:59:15.622106Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.622106Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:07d711fcef5c60293765134f3c80de9f2d81f6f1416e301d40c807cb7294ce17","observation_id":"bfc92a07-7475-461a-83ab-b3b935a2b4bb","resolution":{"observed_at":"2026-08-06T05:59:15.622106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-06T05:59:15.625916Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.625916Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:45f2ae2327d998b78e0540ec9da12202ffe6b1cf572b20b3b85d79f83d9c1e2d","observation_id":"33c7eb08-1cfd-4758-a1b4-9805c31cf4a4","resolution":{"observed_at":"2026-08-06T05:59:15.625916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.975461Z","title":"Instancediffusion: Instance-level control for image generation, 2024","venue":null,"work_id":"d0a09c28-b32e-41b6-a36e-0df79fe95a20","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.629760Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:47a34462895a06419ef7e2ddcd24cda3e7fc858a1f55b87e4b15464917883412","observation_id":"96fecee6-52b3-4c19-86cc-d243bece0746","resolution":{"observed_at":"2026-08-06T05:59:15.978871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08240","last_updated":"2024-11-06T13:03:20Z","snapshot_observed_at":"2026-08-06T07:05:06.994888Z","submitted_at":"2024-09-12T17:39:23Z","title":"IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08240","snapshot_observed_at":"2026-08-06T05:59:15.632916Z","title":"Ifadapter: Instance feature con- trol for grounded text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.632916Z"},"links":{"cited_paper":"/paper/2409.08240","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:eab4a9e54ebcdbcd3411b6004ade13cecff867d0341c861ba86c2a1807e63222","observation_id":"20414764-bd0a-4c08-859f-ab2748069f4c","resolution":{"observed_at":"2026-08-06T05:59:15.632916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.963954Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion","venue":null,"work_id":"159c900a-c955-47ba-a8ec-2fdd927ea2ff","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.636548Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:1c36ba3f941fc05d26935903f250643064168c1699845a04df8bfffa89a1aae0","observation_id":"47190e2e-cb6f-487f-bcd1-6790ca4821e5","resolution":{"observed_at":"2026-08-06T05:59:15.968577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T05:59:15.639954Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.639954Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:9bef377d824a33bf6eb99c67810372ac951f651b16a09c7d6699017a3f7f8a96","observation_id":"11966a8c-fafa-4e4c-96d9-89124b9e32c0","resolution":{"observed_at":"2026-08-06T05:59:15.639954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.953550Z","title":"Detclipv3: To- wards versatile generative open-vocabulary object detection","venue":null,"work_id":"ab8a3d4e-2fd8-4610-bf35-932bf14ad2c0","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.643455Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:0e75075f415cb423f255dd4cf426fc342df13549d84e74922573a624a507d7a4","observation_id":"022bea05-3bf8-41fd-8391-c2ac7527aef8","resolution":{"observed_at":"2026-08-06T05:59:15.957022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-06T05:59:15.646747Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.646747Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:22ee925c45134dd9436d8b2d27c97db96aa9347351066059694915053707063a","observation_id":"75f515f5-2b13-4031-b42c-f47808b2960d","resolution":{"observed_at":"2026-08-06T05:59:15.646747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.650592Z","title":"Glipv2: Unifying localiza- tion and vision-language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.650592Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:302179c3fbecc93854960228d70280d52dc1bc74389616d5041664995bd80da9","observation_id":"ecd1a846-9a9e-466a-abba-79e3f324ca89","resolution":{"observed_at":"2026-08-06T05:59:15.650592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.936938Z","title":"Recognize anything: A strong image tagging model","venue":null,"work_id":"0a389dc1-ffdc-4b96-8ec8-80ade075200c","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.654082Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:a9bc208f6b526a6ddc866dc4c34373e1d5d64abda782cc615e3212ecad903e52","observation_id":"7288b7b2-a5be-45c4-afd7-53cb58ab7dde","resolution":{"observed_at":"2026-08-06T05:59:15.940870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06412","last_updated":"2024-04-13T01:40:03Z","snapshot_observed_at":"2026-07-06T16:05:27.901845Z","submitted_at":"2023-08-11T23:03:50Z","title":"Taming Self-Training for Open-Vocabulary Object Detection","version":3},"cited_work":{"arxiv_id":"2308.06412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06412","snapshot_observed_at":"2026-08-06T05:59:15.693869Z","title":"Taming Self-Training for Open-Vocabulary Object Detection","venue":"cs.CV","work_id":"7dab7794-f09d-478a-865e-c9502c61abb2","year":2023},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.657447Z"},"links":{"cited_paper":"/paper/2308.06412","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:75216f3795f2b1abadeaffa9467399c9840ccc11a3c3506b37edd2d791e7d359","observation_id":"7edd6207-3e5e-40d8-8ede-308d5e5fdb1f","resolution":{"observed_at":"2026-08-06T05:59:15.700057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.926310Z","title":"Migc++: Advanced multi-instance generation controller for image synthesis, 2024","venue":null,"work_id":"6c0e0d39-63e1-458f-b1a0-e1d09baadc62","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.661112Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:65b1359fc69a46f2222779a94cee5349035081ba9dd95d7110ebd75f5558aeab","observation_id":"a440a126-4c4c-4fcc-bac8-52a6dfdd7968","resolution":{"observed_at":"2026-08-06T05:59:15.930189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.915814Z","title":"Migc: Multi-instance generation controller for text-to-image synthesis, 2024","venue":null,"work_id":"d6277ae9-9253-4019-9498-d49a21c16512","year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.664441Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:e009c8ca0683fcc4cb9e0f0fb1d022e053a96d1d1444eb396560b46f246757a3","observation_id":"f78d3fea-f5e6-4e64-b566-b5aa1489c56c","resolution":{"observed_at":"2026-08-06T05:59:15.919475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:59:15.546496Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.546496Z"},"links":{"citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:f3e5a79b6d7b06b85072c5a925f5b050d750770dbef28e401f0ab2d6fce42043","observation_id":"13b8e0a3-f0bb-44e8-b3f7-b80e4667dd9b","resolution":{"observed_at":"2026-08-06T05:59:15.546496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2508.01008."}