{"as_of":"2026-08-05T16:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c8ede18aef9246e4c66b13b6936b083460dea8f21ce6e2593ea1da5866a2af04","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:23:14.354745Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15299/citation-record","integrity":"/paper/2607.15299/integrity","json":"/paper/2607.15299/citation-record.json","paper":"/paper/2607.15299"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:12.297079Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:12.297079Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:1866cceb8cc8d1ed78cb53c4e4fc1237578c1eae2ba583ce410a80dd1e709bde","observation_id":"8d6f1a2f-4de4-4484-b97b-8c267e466609","resolution":{"observed_at":"2026-08-02T08:23:12.297079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:12.387098Z","title":"OK- VQA: A visual question answering benchmark requiring external knowl- edge,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:12.387098Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:a021fa0b3c29f3d7a00fd656ae3316300016c9c691919ff83ea110294c5ebfe0","observation_id":"5f7511da-4b47-4900-856e-b327a92142b8","resolution":{"observed_at":"2026-08-02T08:23:12.387098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:12.539193Z","title":"A-OKVQA: A benchmark for visual question answering using world knowledge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:12.539193Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:7e77fc5949528ef41cde3d6caeffbbb5107d05bc4adeeb6cef570b54cee80f26","observation_id":"a7589eeb-f542-4c20-acf5-6306847b39e7","resolution":{"observed_at":"2026-08-02T08:23:12.539193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:12.616648Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:12.616648Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:ea95497ab319749468e1e379c28e76b40cceb34a992f61936c42082643b25605","observation_id":"070beb76-55d4-4868-8d81-0e8aaded7ad2","resolution":{"observed_at":"2026-08-02T08:23:12.616648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:12.669130Z","title":"OCR- VQA: visual question answering by reading text in images,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:12.669130Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:5dbc803034d702a08e251d4dae8e2e445828bca3f2f5187609166709701729aa","observation_id":"1b26718d-569d-431e-a5ec-70b24278b39f","resolution":{"observed_at":"2026-08-02T08:23:12.669130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:12.749017Z","title":"Textcaps: A dataset for image captioning with reading comprehension,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:12.749017Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:f31edb18436bf2f110fbafb45143cb6047d2f551f5f274901a790471ff2d9436","observation_id":"6dda5378-58d8-4dae-b809-4bae903e56da","resolution":{"observed_at":"2026-08-02T08:23:12.749017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:12.833347Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:12.833347Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:d90c842779b1352ec905b5c27bf56f05535b356a08508e68133e76c4066a8a8d","observation_id":"bde9422d-61ac-439a-96db-62e1e6eab3ef","resolution":{"observed_at":"2026-08-02T08:23:12.833347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:12.911774Z","title":"Sharegpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:12.911774Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:acba1fa05deccd2140d0ea23c253ed9f77d09bffe19898e43410b9d69a1cfdbd","observation_id":"ed94dae2-9208-426f-8483-af98f01e7dcc","resolution":{"observed_at":"2026-08-02T08:23:12.911774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:12.971059Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image anno- tations,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:12.971059Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:cdc294fa4dd8321d42f846ecbc7576eb083a99ce69774cbc1ac4ce7709dbd026","observation_id":"b1b76ce2-408b-4eff-a344-2e8c7338d282","resolution":{"observed_at":"2026-08-02T08:23:12.971059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:13.053830Z","title":"Generation and comprehension of unambiguous object descriptions,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:13.053830Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:329533ed7e3ebc2b4fa22f841c9178f32eeaa1fe9ebb9e01786e4c675e9c3811","observation_id":"02fa0fda-7c41-40b4-b63a-686b99b42b05","resolution":{"observed_at":"2026-08-02T08:23:13.053830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:13.092521Z","title":"Refer- itgame: Referring to objects in photographs of natural scenes,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:13.092521Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:d0198b8f3dbc1778b24c55d0ab88240a2771f0bf337e2a3bc128fcab5741a04c","observation_id":"c7f12c14-d9fb-4f90-aa6b-c377820cccc9","resolution":{"observed_at":"2026-08-02T08:23:13.092521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-02T08:23:13.162780Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:13.162780Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:a068b590d9ed07bede2973cba010df16e559d024cd54fc07a72afa0c3e7882a4","observation_id":"6f1f453a-b2ce-486c-b88c-74f4262453e6","resolution":{"observed_at":"2026-08-02T08:23:13.162780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-02T08:23:13.248396Z","title":"Mmbench: Is your multi-modal model an all-around player?,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:13.248396Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:f768392c2c66f4b47824b60c8e07dcdb92476935591ade9630ba3463173e4dd3","observation_id":"4f5d8d4c-677f-4598-94ac-0eb6dd580342","resolution":{"observed_at":"2026-08-02T08:23:13.248396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-02T08:23:13.395817Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:13.395817Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:58a54fbc77ed30fdc252c96320eeb7ca91f4a1c256b4d4a3dd4bb274903f4aed","observation_id":"67d0a9e9-c703-4375-8efc-8d5991930764","resolution":{"observed_at":"2026-08-02T08:23:13.395817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:13.524066Z","title":"Vizwiz grand challenge: Answering visual questions from blind people,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:13.524066Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:1f168e5e3d0f9103d7a9fb3350f2ef6be78348211f637a90e2af2e241c2d2c31","observation_id":"b74e29df-3210-4a02-bd52-f2f67d35b039","resolution":{"observed_at":"2026-08-02T08:23:13.524066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:13.604750Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answer- ing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:13.604750Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:b7bd6e0713fdc990790c43d13cdb321e480a5896f11cbf602adcfef74b3d115d","observation_id":"33885bec-54c8-416b-a3b1-db428c84249b","resolution":{"observed_at":"2026-08-02T08:23:13.604750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:13.704757Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:13.704757Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:8299f833400b83446c84cce2560e8ec29b13d576e9690754f981a1ea0089b599","observation_id":"19242688-f65a-4278-b718-2d4cd6f0e09a","resolution":{"observed_at":"2026-08-02T08:23:13.704757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:13.771956Z","title":"Microsoft COCO: common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:13.771956Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:c62d499460de7d535b872c5918cae8dce13cbf550c9e7a9d66ff8a471f2e3c2f","observation_id":"c5469f98-fd0b-4730-9176-40afac55a812","resolution":{"observed_at":"2026-08-02T08:23:13.771956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:13.916582Z","title":"Modeling context in referring expressions,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:13.916582Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:cd02b5242aeb241b616d27fbc0a49df38a2fff638c380ef313e16a4fc4844725","observation_id":"57656ff4-27ec-42ad-8f40-1ffc53d41149","resolution":{"observed_at":"2026-08-02T08:23:13.916582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:14.064741Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:14.064741Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:b1f12b12e8c41e87b71154a06af039de46f8b00a5c31daec67baf4c1c47fca04","observation_id":"23af5645-73a3-4504-9f2a-af38d4cbbf08","resolution":{"observed_at":"2026-08-02T08:23:14.064741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:23:14.194756Z","title":"Visual spatial reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:14.194756Z"},"links":{"citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:65e5d78e3d089b7e03f6680281620e03ec446f0b9bed1d981793a36f4dada452","observation_id":"e3880485-2a00-40ba-b9e0-74d8a9587740","resolution":{"observed_at":"2026-08-02T08:23:14.194756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-02T08:23:14.354745Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T08:23:14.354745Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2607.15299"},"observation_digest":"sha256:c5da716c91675e3c3da1ff2192816a99b677596ff9098186fda93e5543807eea","observation_id":"c43f9043-16e9-4b09-97ac-6a599b8aa2dd","resolution":{"observed_at":"2026-08-02T08:23:14.354745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15299","last_updated":"2026-07-07T08:35:38Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-03T23:26:48.176472Z","submitted_at":"2026-07-07T08:35:38Z","title":"MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2607.15299."}