Pith. sign in

Paper Citation Record · LEDGER

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation

As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2508.01008.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.01008 v1

Coverage vector

measured 62 of 62 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T05:59:15.664441Z

measured 62 of 62 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

62 of 62 outbound references displayed

  • verified exact1
  • verified fuzzy26
  • unresolved35
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 77de1c1f-5091-4938-912a-95ea6d7ab884 · outbound

This paper cites GPT-4 Technical Report.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.447253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.447253Z digest=sha256:06cc0520edebcb9f54bd5304434a77f7a62c81685aa6bcd292ad5113a7d18b3d

Observation f33e43e0-5ac2-4c4c-8846-dc8f5da62df4 · outbound

This paper cites Multidiffusion: Fusing diffusion paths for controlled image generation, 2023.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Multidiffusion: Fusing diffusion paths for controlled image generation, 2023

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.257836Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.452642Z digest=sha256:ee05886c1afd9165b0aa3ae6a90840c79cceef297b68897a1e2e27c7f035ee63

Observation ef88c5b7-ba2f-4644-8814-2ded100596c5 · outbound

This paper cites Coyo-700m: Image-text pair dataset.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Coyo-700m: Image-text pair dataset

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.246018Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.456356Z digest=sha256:3b269566708dfefa194f033506a1301de6fef6f72f12dc98bf199a08c19eedb2

Observation 3e6b6bcd-aa20-4a8d-b405-71ccf698ba34 · outbound

This paper cites InternLM2 Technical Report.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation InternLM2 Technical Report

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.459932Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.459932Z digest=sha256:24b889f1e3b07300ca70f35ad7a4f0aa11bb5961f96c22a403e0d14a77683c78

Observation 7a802e98-d67a-45ec-9e3b-86fedc30fa33 · outbound

This paper cites PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.463874Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.463874Z digest=sha256:025c77edd757829e8a2999e88e1089c7d81891ab0c33bdb01de76f4dafa9709b

Observation a57f74c1-180f-4dfc-b297-6559e7eb33a7 · outbound

This paper cites Training-free layout control with cross-attention guidance.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Training-free layout control with cross-attention guidance

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.235144Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.468885Z digest=sha256:86e79986cd7886c67a84b75323c14aacf7c143b5f71e333e618c8d40c8865cc2

Observation 2701598b-bad2-4951-823f-fd574c4888c2 · outbound

This paper cites How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.472695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.472695Z digest=sha256:3d716f4cf6d68d7d7e7693c34e7c28541d9697e010863828b7faecd8c7f55f54

Observation fff1f503-be48-4288-bdd8-83c895fcb5e5 · outbound

This paper cites Yolo-world: Real-time open-vocabulary object detection.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Yolo-world: Real-time open-vocabulary object detection

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.224851Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.476994Z digest=sha256:ef8ad784ed3fa3b2bffebcb79c902d884265150a7f94aea8150475d8db84aca3

Observation 7b7cdf4a-83c0-4d7a-b55d-36bb5c69dc3c · outbound

This paper cites Laion pop: 600,000 high-resolution images with detailed descriptions.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Laion pop: 600,000 high-resolution images with detailed descriptions

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.213947Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.480962Z digest=sha256:c350329230c552879b9292d5ef192cb0dd1534ecfd78eed914678f9f59db71ba

Observation 50095dc7-82b3-46e9-aa8d-9d29971cf9c3 · outbound

This paper cites The Llama 3 Herd of Models.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation The Llama 3 Herd of Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.484280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.484280Z digest=sha256:cab0418b995dfb6879cb524c6e4eb8022f55fb0a311d0462a3e181a23fc31a34

Observation 9438a0ce-ce74-4342-978f-57d03d86a504 · outbound

This paper cites Scaling recti- fied flow transformers for high-resolution image synthesis.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Scaling recti- fied flow transformers for high-resolution image synthesis

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.203931Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.488421Z digest=sha256:0987e2b2f2791dbb4d93be7c6912d912e5bbcbfc74898d15e6dbf8f22099f468

Observation 93e15a82-0e6c-4825-9092-8b0da2d411f8 · outbound

This paper cites Ranni: Taming text-to-image diffu- sion for accurate instruction following.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Ranni: Taming text-to-image diffu- sion for accurate instruction following

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.193135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.491661Z digest=sha256:46cd056f0aefc2751704a780360996eaafa49efc39096ee1c0aa5ea5ce7a8614

Observation e6dc0a98-1f1e-4dd8-af7e-2e8d392853db · outbound

This paper cites ImageInWords: Unlocking Hyper-Detailed Image Descriptions.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation ImageInWords: Unlocking Hyper-Detailed Image Descriptions

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.495125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.495125Z digest=sha256:dc3abb352e669d27ed38a780e861c945762984d461acb93564f54d3935e9fe87

Observation 5a4d026d-e51f-4c69-a263-2353e07f88ec · outbound

This paper cites ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.498764Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.498764Z digest=sha256:eeb0d6f1e056f73036f2b8b4243cff6b9ed836010874387d5196de81941c7d6f

Observation ec4ef736-a22c-4e54-80d8-2e2fcf0e8f87 · outbound

This paper cites Generative adversarial networks.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Generative adversarial networks

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.502311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.502311Z digest=sha256:9b395cdb6e42d75831fa5c12ab8696a43e41831eae9189a3b28123894aa63966

Observation 9d6ebf94-b546-4cf6-a2f0-048608780046 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.505850Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.505850Z digest=sha256:c45da50995089fd493526612784e06b125d10c19ea9ce22c166dcffce795a88f

Observation a68c98e0-5d59-45c3-bc17-f5f3da9c8edc · outbound

This paper cites LVIS: A dataset for large vocabulary instance segmentation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation LVIS: A dataset for large vocabulary instance segmentation

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.177516Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.509041Z digest=sha256:2d44324c9adcd797e7b861999840b9e767f84011db46caa7be41562326d87a5b

Observation 2e451c29-f81e-4700-93a1-111666ef7e24 · outbound

This paper cites Retrieval-augmented open-vocabulary object detec- tion.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Retrieval-augmented open-vocabulary object detec- tion

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.167216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.512266Z digest=sha256:29d108a9e85a68a2f6e8bf41b276bde88b214a6a0bebd926460ef04031463ac5

Observation 56937916-9015-48ff-8881-f86b7f20af56 · outbound

This paper cites Dense text-to-image generation with attention modulation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Dense text-to-image generation with attention modulation

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.157206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.515883Z digest=sha256:d4a12facca8f8a1bc3549090233b675fbb94fcc0739b82d5078d9f72e7493aa2

Observation 9f95e6be-3bc2-4573-a786-0fcd6d081036 · outbound

This paper cites The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.146463Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.519045Z digest=sha256:ef26742b4387229ffcc14228db6b53e69cc4a183fe7cf606d64b398dd60ca95f

Observation 464d037d-087b-49e0-9697-6f1fcd9db6f0 · outbound

This paper cites an unresolved cited work.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-06T05:59:16.136002Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.522276Z digest=sha256:7e549c159bf441f0cf8bf2ecb6e0b603668ee3428dc70eb734ec364d328ad113

Observation d3545566-8d32-40b4-aa70-4d3e0ffd41e4 · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.525838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.525838Z digest=sha256:15a11b0750e754960c055c7f8cc72369bd068d207f2d41990bd2743c16fed520

Observation e6613a77-2f33-4490-a7b4-c1de1d298e74 · outbound

This paper cites Grounded language-image pre-training.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Grounded language-image pre-training

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.528965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.528965Z digest=sha256:ca1737bed04bde4aaa662c545de3c81abd18e141a48e1fb0c07fa43292f4d8be

Observation 65e9596d-df25-4270-9e01-7f6ddaa0cb37 · outbound

This paper cites Autoregressive Image Generation without Vector Quantization.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Autoregressive Image Generation without Vector Quantization

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.532357Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.532357Z digest=sha256:d012081147ba36ecd49b6324f395cc826a07e1f1961dcb114aa6085c65dfd9ce

Observation 584874c4-b51e-4df2-be1c-ad3ddeaf8f06 · outbound

This paper cites Gligen: Open-set grounded text-to-image generation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Gligen: Open-set grounded text-to-image generation

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.114320Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.535880Z digest=sha256:a866893d55877e72a2fa43efa0f453cb5ff77f603a8fa92c6c53b5e81b6f1079

Observation 0a12d2be-2083-4d49-a18a-e96e4b528ae4 · outbound

This paper cites Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.539301Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.539301Z digest=sha256:16b2694bead27cec894fa3f239419f7eefd9d2eeb049f1ed2a0205b7938e158f

Observation 8cef9ff0-f18e-4e6d-8890-d331dedf1ee3 · outbound

This paper cites Lawrence Zitnick.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Lawrence Zitnick

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.104144Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.543230Z digest=sha256:cafc8eb7a08a0421da97a4a493dc5ddc9f903e962a74de8a2609aa5525737be4

Observation 2972c372-c46f-4923-8e19-7c1e3701b694 · outbound

This paper cites Visual instruction tuning.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Visual instruction tuning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.549776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.549776Z digest=sha256:0daa21d2502816f178e9afee75bc6cb4036b512291e9aec6c1ba2833e3681d2c

Observation 799ba3a8-7c66-47d6-a6db-eaa58a0cc94a · outbound

This paper cites Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.553172Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.553172Z digest=sha256:52abada2a269b3050f09f15622d047a264ca187b0878171969f4643a85776ead

Observation 798db917-1c23-4eec-abe9-48093b64d801 · outbound

This paper cites Scaling open-vocabulary object detection.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Scaling open-vocabulary object detection

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.081578Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.556574Z digest=sha256:786cf5dceb931e4cd73162f67fd4d8c0d095a5ffb784b7a7233f5e13b542c507

Observation c1b18570-5a77-4e14-9520-86630e70cc47 · outbound

This paper cites DOCCI: Descriptions of Connected and Contrasting Images.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation DOCCI: Descriptions of Connected and Contrasting Images

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.559791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.559791Z digest=sha256:3205f87dd1e69490262ea268f4ed8a50da2d6db62f6c3e824ae04c3cbf751e16

Observation 85db6f9c-64c4-4290-9846-e28f3d23432d · outbound

This paper cites Gpt-4v(ision) system card.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Gpt-4v(ision) system card

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.563418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.563418Z digest=sha256:8279fe0f7c94378bcc15df3478dddaf4d160f5387451a9eb471f13974767b44c

Observation 98b81ee6-cd5e-49ce-9fd9-270e1e435e55 · outbound

This paper cites Scalable diffusion models with transformers.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Scalable diffusion models with transformers

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.567213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.567213Z digest=sha256:7f993d4fff2cfe5b8a5c84df2ade7117a9d6dcb9048e8ee4f05bc1106ce4cb0f

Observation 1837cca4-5c02-4d3f-8e1d-aaf441661d65 · outbound

This paper cites Grounded text-to-image synthesis with attention refocusing.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Grounded text-to-image synthesis with attention refocusing

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.059036Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.570668Z digest=sha256:e6619c8d76c1d1ee13ee2fff7a95ccd2311587004db594b6960e84c705fd8146

Observation 908b97f6-22de-4fb2-afdc-1d8c298085bc · outbound

This paper cites SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.573917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.573917Z digest=sha256:67bc3104aaa46b2cda2256468171cfd383044f6b23b624cb7a9993aac9fcd668

Observation 7024cd76-2a0d-4eac-b776-c3a1ede5c2a1 · outbound

This paper cites Stanza: A Python Natural Language Processing Toolkit for Many Human Languages.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Stanza: A Python Natural Language Processing Toolkit for Many Human Languages

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.577307Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.577307Z digest=sha256:7435e1a854337f1846d3f7e8df4d25937b9d281558fe4196752aa25d1cc86e5a

Observation afaf257b-0d06-4304-b251-59a663769a15 · outbound

This paper cites Learning transferable visual models from natural language supervi- sion.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Learning transferable visual models from natural language supervi- sion

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.580791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.580791Z digest=sha256:79ade34ba52fc993a0d28e4f512895a319dfae3f7c371e1d6a38a628f239d56f

Observation 37938214-507b-4431-8e29-4124034599db · outbound

This paper cites Zero-shot text-to-image generation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Zero-shot text-to-image generation

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.583942Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.583942Z digest=sha256:f01de90a820317867ea6bf650a6bae2d2d45428c2c6ccdb364ef90541948dd85

Observation b8a4b91e-1cbe-4866-8916-23bf32daaf28 · outbound

This paper cites Stable diffusion v1.4 checkpoint.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Stable diffusion v1.4 checkpoint

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.036870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.587044Z digest=sha256:194fa5a4530954e93dbe6c3ede08f22336afdacc259f08eb1d5cd2e5eff33b4b

Observation e9e2b47d-7207-4603-92cc-7fafccf75e71 · outbound

This paper cites High-resolution image synthesis with latent diffusion models.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation High-resolution image synthesis with latent diffusion models

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.026532Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.590226Z digest=sha256:da06f1c139fb07b71ea3dff1d6f0a6bf2ea7aa1d5b8fc730e60abfae1eee7c5f

Observation 9d4a3a27-5444-48bf-a621-28759a4034b5 · outbound

This paper cites Laion-aesthetics.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Laion-aesthetics

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:16.016615Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.593501Z digest=sha256:8764729c9181963a856f736dd4fea0c043f2755619b4b97022c9832c0b41a169

Observation f4fa66e1-ddd9-4b72-a679-bfe17225964c · outbound

This paper cites Laion-5b: An open large-scale dataset for training next generation image-text models.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Laion-5b: An open large-scale dataset for training next generation image-text models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.596983Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.596983Z digest=sha256:8c496edbbbfda4de411dff9a3fa06a6980ee2960a991f1ad3ab90ed6331fda9d

Observation 4d9d324e-7f0f-45f4-b0ec-5ecbacbdd76f · outbound

This paper cites Objects365: A large-scale, high-quality dataset for object detection.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Objects365: A large-scale, high-quality dataset for object detection

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.999193Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.600205Z digest=sha256:e982cbfeca3009dbc6330c5d5e41a28f234a9985654cbffd471d43cc675d6863

Observation ce87387f-6774-4174-adf5-76bfa3e64914 · outbound

This paper cites From Pixels to Prose: A Large Dataset of Dense Image Captions.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation From Pixels to Prose: A Large Dataset of Dense Image Captions

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.603444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.603444Z digest=sha256:7dcf34c823412295fefc3aaadeb4c24f56156d724f19ced004c0da0bb7c0e9c1

Observation f2d401de-1157-4434-96b8-28f7dea11fce · outbound

This paper cites Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.607151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.607151Z digest=sha256:867b5560d1c83786328c0ed8146bebe6006e49729e5cbd83ab37d2e1b02b4181

Observation 38c09d6d-ded2-4e7b-b0ad-e15987f7c9b6 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.610644Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.610644Z digest=sha256:1d8dc7aa25327e6acb60e0c61e48a18dc1a10393a676131cde705d90c2d2f7ef

Observation 9742e30f-4e89-4261-add6-acde697eeb25 · outbound

This paper cites OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.615039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.615039Z digest=sha256:72d5f7d839caebb9449916a3a77e9f43dea12af05c792f3d5f72d26fb1507868

Observation 6f6a7ee7-658f-4415-8b68-9d49ee5de36f · outbound

This paper cites V3det: Vast vocabulary visual detection dataset.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation V3det: Vast vocabulary visual detection dataset

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.988752Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.618896Z digest=sha256:479355761d2100858401248a0c1dfa509ef6598e8ff00eb7a8cf26fd5410d334

Observation bfc92a07-7475-461a-83ab-b3b935a2b4bb · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.622106Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.622106Z digest=sha256:8b8f66d82c5ac91ed9a120bfdcc0d8bcea1ccfbd97864aea5b966b79a5b77585

Observation 33c7eb08-1cfd-4758-a1b4-9805c31cf4a4 · outbound

This paper cites CogVLM: Visual Expert for Pretrained Language Models.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation CogVLM: Visual Expert for Pretrained Language Models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.625916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.625916Z digest=sha256:0ea86c01061868bb42aca764a49238b214631c182312e073804faa82a1b23f1b

Observation 96fecee6-52b3-4c19-86cc-d243bece0746 · outbound

This paper cites Instancediffusion: Instance-level control for image generation, 2024.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Instancediffusion: Instance-level control for image generation, 2024

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.978871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.629760Z digest=sha256:18bef7953a3acc95d73973e4892c8f4e0f0425aa8d068199ce4d24233e5bc2c8

Observation 20414764-bd0a-4c08-859f-ab2748069f4c · outbound

This paper cites IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.632916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.632916Z digest=sha256:b71e610c15c627958c7940cc3f9348fea85f02d3648a96641031f3c1cbd62ede

Observation 47190e2e-cb6f-487f-bcd1-6790ca4821e5 · outbound

This paper cites Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.968577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.636548Z digest=sha256:26a29aecaa2f3a68568097a96f58ca671d4a2d680407da976965703ff4715b53

Observation 11966a8c-fafa-4e4c-96d9-89124b9e32c0 · outbound

This paper cites Qwen2 Technical Report.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Qwen2 Technical Report

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.639954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.639954Z digest=sha256:7f6891c8e3a8782acfdd6f4f823ee0b2a66c3b31d5dbf34f213bbbd6f0159dee

Observation 022bea05-3bf8-41fd-8391-c2ac7527aef8 · outbound

This paper cites Detclipv3: To- wards versatile generative open-vocabulary object detection.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Detclipv3: To- wards versatile generative open-vocabulary object detection

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.957022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.643455Z digest=sha256:47ab64daffbd89c7421f938f5c86bdc2e55b3d9271360607df55292397690030

Observation 75f515f5-2b13-4031-b42c-f47808b2960d · outbound

This paper cites Scaling Autoregressive Models for Content-Rich Text-to-Image Generation.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Scaling Autoregressive Models for Content-Rich Text-to-Image Generation

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.646747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.646747Z digest=sha256:40f13c6fe332027ce3ddeb1e2f50b0a8e25570e14670134340b18e2c8d3eb04e

Observation ecd1a846-9a9e-466a-abba-79e3f324ca89 · outbound

This paper cites Glipv2: Unifying localiza- tion and vision-language understanding.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Glipv2: Unifying localiza- tion and vision-language understanding

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.650592Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.650592Z digest=sha256:90403d07db2c923fa503cca0d60e99685472f947766dde8684f4842a65646703

Observation 7288b7b2-a5be-45c4-afd7-53cb58ab7dde · outbound

This paper cites Recognize anything: A strong image tagging model.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Recognize anything: A strong image tagging model

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.940870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.654082Z digest=sha256:c7c810f26e2aef15db64aab2204a32a60865a4cb0cde595132e929de3c78755d

Observation 7edd6207-3e5e-40d8-8ede-308d5e5fdb1f · outbound

This paper cites Taming Self-Training for Open-Vocabulary Object Detection.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Taming Self-Training for Open-Vocabulary Object Detection

Reference 59

Resolution
verified exact
local_arxiv, observed 2026-08-06T05:59:15.700057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.657447Z digest=sha256:dff19da67906c1b5e28ac434cbd063ab9242656dcdce857ce767619afa41b660

Observation a440a126-4c4c-4fcc-bac8-52a6dfdd7968 · outbound

This paper cites Migc++: Advanced multi-instance generation controller for image synthesis, 2024.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Migc++: Advanced multi-instance generation controller for image synthesis, 2024

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.930189Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.661112Z digest=sha256:d087a970de3b6ca89412356db8d5757c63750de1de98bf575345935be6b4b72a

Observation f78d3fea-f5e6-4e64-b566-b5aa1489c56c · outbound

This paper cites Migc: Multi-instance generation controller for text-to-image synthesis, 2024.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Migc: Multi-instance generation controller for text-to-image synthesis, 2024

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T05:59:15.919475Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T05:59:15.664441Z digest=sha256:c11e1c9dc4f7714d9fa8f5a1a124e1e39f9a3a696b5578d1d13c22b0aab79a5e

Observation 13b8e0a3-f0bb-44e8-b3f7-b80e4667dd9b · outbound

This paper cites an unresolved cited work.

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation Unresolved cited work

Reference 2014

Resolution
unresolved
no resolver link, observed 2026-08-06T05:59:15.546496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:59:15.546496Z digest=sha256:d135833ae666c5551123240c85183031578771bf627d8ed1cb15816a81a54f43

Pith citing papers

No inbound Pith citation observations are available.