{"as_of":"2026-08-07T08:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56ed84c413c9d42c955b8ff84a81238b466742f01b5caca5bcefd30a6843fd86","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:24:55.227295Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08513/citation-record","integrity":"/paper/2507.08513/integrity","json":"/paper/2507.08513/citation-record.json","paper":"/paper/2507.08513"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.966495Z","title":"Claude v3.0, 2024","venue":null,"work_id":"11256bbb-902a-4a52-b489-c0cdcce75229","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:26.349606Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:51de094cac9cc697eac63744cb32911503fb33506e01120dc56140491a04785a","observation_id":"22aedcb8-1c69-4983-b2da-fb13d0a3b8c5","resolution":{"observed_at":"2026-08-06T18:25:19.970840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03012","last_updated":"2015-12-09T19:42:48Z","snapshot_observed_at":"2026-08-07T07:52:43.472531Z","submitted_at":"2015-12-09T19:42:48Z","title":"ShapeNet: An Information-Rich 3D Model Repository","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03012","snapshot_observed_at":"2026-08-06T18:24:26.443277Z","title":"Shapenet: An information-rich 3d model repository","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:26.443277Z"},"links":{"cited_paper":"/paper/1512.03012","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:cbcaa3bea7f253747d08441f20f48cf20569cb087f1fd1ad02c287ba922d93fa","observation_id":"23ebc90b-877b-4010-9729-4f7bafea106f","resolution":{"observed_at":"2026-08-06T18:24:26.443277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:26.519860Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:26.519860Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:9cd650f8db819436cb1de65a1f03e690a5eddf1e5b91693da7615da85faaebe3","observation_id":"ee36dacf-f13c-487a-9253-a849d2a1a051","resolution":{"observed_at":"2026-08-06T18:24:26.519860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T18:24:26.584334Z","title":"Allava: Harness- ing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:26.584334Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:8e38b94cb162263a3cf47a6917c02de1ce0dd92b2ae8e6d912d22d58537ec7a3","observation_id":"c74c8ca2-29e0-459b-8ba7-1b55b8ab2e6c","resolution":{"observed_at":"2026-08-06T18:24:26.584334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:50.359030Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.359030Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:e799eea251181bfed9952aa102208609066624a9bb576b2640ccee2bc0f0c68d","observation_id":"d46bf874-ec93-4731-aaae-f46aba4d136a","resolution":{"observed_at":"2026-08-06T18:24:50.359030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-06T18:24:50.450996Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.450996Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:6120a97b4ba51a1240466b012a87b43952a7c380ff80b855e0f090d428f5b42d","observation_id":"a214032c-b48a-448e-b668-586e250128f4","resolution":{"observed_at":"2026-08-06T18:24:50.450996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:50.501932Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.501932Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:2fa5f4e882d862b6695a79197b32137bff81e17778a82daf58d2e7200b632b4a","observation_id":"e78d2225-ca41-4d40-9ac2-964e0bcdc054","resolution":{"observed_at":"2026-08-06T18:24:50.501932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:50.640240Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.640240Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:2b73618ae626a0220a55edcf42abc467b5fed8dbf1a11d47016521757a2371bb","observation_id":"c0a5888e-9cac-4437-b9ef-a5f1d2f6639a","resolution":{"observed_at":"2026-08-06T18:24:50.640240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.899514Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":"4feeb1e2-7460-4265-8f14-fdcf769aa0e4","year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.721353Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:f83ce672c3744badb2f27ce71a75179d834a46484f8ae8ee283fae6deca53118","observation_id":"d840d744-f67b-413a-a7ef-e6193407eb5d","resolution":{"observed_at":"2026-08-06T18:25:19.904748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.881207Z","title":"Objaverse-xl: A universe of 10m+ 3d objects","venue":null,"work_id":"00c57124-25bb-4ffd-bbe4-fc6a93ce6f07","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.780968Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:32a06c58c984640aed64be5e09f65cbae974c85a3a8b57113c0393de3454dc07","observation_id":"9ace1d4d-271b-4046-a81c-b2968a3a5186","resolution":{"observed_at":"2026-08-06T18:25:19.887292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T18:24:50.875281Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.875281Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:db668d55d4fad09d545001189d3f7aec1d02857ac7e043ef9528d5e304a7de07","observation_id":"67c8ed4e-ed69-437f-8081-08a895706f20","resolution":{"observed_at":"2026-08-06T18:24:50.875281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01487","last_updated":"2025-02-05T09:06:42Z","snapshot_observed_at":"2026-08-05T04:29:05.120535Z","submitted_at":"2023-11-02T15:36:12Z","title":"What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01487","snapshot_observed_at":"2026-08-06T18:24:50.966995Z","title":"What makes for good visual instructions? synthesizing complex visual reasoning instructions for visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:50.966995Z"},"links":{"cited_paper":"/paper/2311.01487","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:3162145df89c3e1e4f2808a133a9f8efe36d4c99efa90f8b8ef22b601bcab008","observation_id":"e86d4e51-015f-42ad-bb9f-5d43029e79b4","resolution":{"observed_at":"2026-08-06T18:24:50.966995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03025","last_updated":"2023-12-05T08:11:34Z","snapshot_observed_at":"2026-07-06T16:57:21.997777Z","submitted_at":"2023-12-05T08:11:34Z","title":"Training on Synthetic Data Beats Real Data in Multimodal Relation Extraction","version":1},"cited_work":{"arxiv_id":"2312.03025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.03025","snapshot_observed_at":"2026-08-06T18:24:55.706756Z","title":"Training on Synthetic Data Beats Real Data in Multimodal Relation Extraction","venue":"cs.AI","work_id":"4aa403de-a019-4a4d-919b-5cddc1ea182f","year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.055242Z"},"links":{"cited_paper":"/paper/2312.03025","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:a47bbf41d841a65b29e315f9d5370f37dbc61cffc2b613a994f6e0a9c5e50542","observation_id":"336ad5c2-4776-4d06-ae92-5c7c304cd5a7","resolution":{"observed_at":"2026-08-06T18:24:55.779515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-06T18:24:51.096889Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.096889Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:515358ad25b949fb2653f73b1235074689091eaddba546f42591de872a9d88be","observation_id":"4e757f10-5bb8-4a03-bdcd-822a6fc97c6c","resolution":{"observed_at":"2026-08-06T18:24:51.096889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.862706Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"fd172664-a6f5-4d7d-8158-57c399ef7f09","year":2017},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.180173Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:81f81b7abd352ec294176337669c7fa2728a62367ac4a99667fe1bf58c43964c","observation_id":"c730f22a-0a89-4e9e-8226-a4143ac99b18","resolution":{"observed_at":"2026-08-06T18:25:19.868412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.843451Z","title":"Kubric: A scalable dataset generator","venue":null,"work_id":"d6789580-b938-4410-b993-4ae5f7237d67","year":2022},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.252372Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:fda040fb098bfb3d6a03c9086ba5fdbffbe7f6ef4f3e64520bb7ce30a3ef1fc3","observation_id":"5dd674ed-5472-40dd-b3fa-5fe03143854e","resolution":{"observed_at":"2026-08-06T18:25:19.852158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.826058Z","title":"Regiongpt: Towards region understanding vision lan- guage model","venue":null,"work_id":"2f60d284-e736-41ef-98ca-b206f2384881","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.328234Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:cfd9cbc2e36c197b04ae61b9eb501af35eb48fbc1a62b2bba99b217039f500cc","observation_id":"9356ccb3-194f-4f3a-b89f-5c7733380849","resolution":{"observed_at":"2026-08-06T18:25:19.832620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.807713Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"a2e9d351-4056-4e76-bb74-255892f350a7","year":2019},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.398073Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:4d48992c1177884e0e4419a4fe106500598a2f7adda06d2c9c41c9aa27defb3f","observation_id":"953075ef-eae8-48c0-b500-13bd6b9b84be","resolution":{"observed_at":"2026-08-06T18:25:19.814743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.445774Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.445774Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:f37bd9b8b35bb3d9c5482584e80804492a92de22a4258fd9088bf26972cde8e0","observation_id":"4cacf1a3-b313-423c-a996-4dda7392e2a0","resolution":{"observed_at":"2026-08-06T18:24:51.445774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T18:24:51.489571Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.489571Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:b40f2358153d06ca1db4f8c53b165955f7fa0a9329c1c9b321e13d2e72ef13bb","observation_id":"9577be88-486f-4125-b157-813f5b0e6346","resolution":{"observed_at":"2026-08-06T18:24:51.489571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-06T18:24:51.541947Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.541947Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:ebe0d6f9ddecff93a0854d967e3040733d6c17d67ee72ffd26b50675c955f1fd","observation_id":"2bf75061-9736-4928-9110-4fe24c39642c","resolution":{"observed_at":"2026-08-06T18:24:51.541947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.592721Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.592721Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:3839e96e119e1e088d09aae22aaa98d4e8a576613c53d3899faf4b7196628faa","observation_id":"75415d62-cf08-44fe-a973-1581acc6461e","resolution":{"observed_at":"2026-08-06T18:24:51.592721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.640713Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.640713Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:8e034218cf25a771cb6120d8df9f60abe5207a58b7e6e863f5ad60ed9d022f74","observation_id":"04d06e66-6699-4701-9838-9557421ee249","resolution":{"observed_at":"2026-08-06T18:24:51.640713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.751251Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"de8cd998-aa13-4e41-8897-2d067413ff24","year":2019},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.712219Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:78ad34131c88f8b814b2ddd372c70997d1ce598a43e8c06f47a5c26e80bf9f37","observation_id":"31ab4b62-2a33-42f6-898d-1e9c7a8e186b","resolution":{"observed_at":"2026-08-06T18:25:19.756961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.727597Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"d5874611-b440-4e36-a256-e079914155ae","year":2017},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.765806Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:2c1a5a554ad2fc28118e9e39bd4e4f49c49072cfb810730ca225437f1917e98a","observation_id":"089ba357-1387-443c-8879-f522d36d1506","resolution":{"observed_at":"2026-08-06T18:25:19.739583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.825630Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.825630Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:2b16fa88910964f1ebcd635ca67da94efe01e9c22a796499da85e5ef654826ab","observation_id":"095a08c1-e4e2-4643-8893-59ab52b7ae9d","resolution":{"observed_at":"2026-08-06T18:24:51.825630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03471","last_updated":"2024-10-17T15:12:44Z","snapshot_observed_at":"2026-08-05T08:34:20.852488Z","submitted_at":"2024-07-03T19:36:33Z","title":"Learning Action and Reasoning-Centric Image Editing from Videos and Simulations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03471","snapshot_observed_at":"2026-08-06T18:24:51.875150Z","title":"Learning action and reasoning-centric image editing from videos and simulations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.875150Z"},"links":{"cited_paper":"/paper/2407.03471","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:b5b3859e3cb9e6285844ca0a8fca5c6b554d785647782fd6cb3a01c7c6c2d69a","observation_id":"8614b7fd-4116-423d-9fa5-881825ac47d2","resolution":{"observed_at":"2026-08-06T18:24:51.875150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T18:24:51.915011Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.915011Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:a9ee3f68713a4ce7c575ea2389d5782f7fad38e5b326a7116a0c2ea40458864f","observation_id":"b730cbda-5bef-43f6-8798-4771a4d6016f","resolution":{"observed_at":"2026-08-06T18:24:51.915011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:51.958093Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.958093Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:8fc96009a20ad090e8b642b3c8eb9cc70972c2e01941ae0525f647bc8749455a","observation_id":"0b07225c-fcd3-491d-a3f7-858971ef0997","resolution":{"observed_at":"2026-08-06T18:24:51.958093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-06T18:24:52.066023Z","title":"What if we recaption billions of web images with llama-3? arXiv preprint arXiv:2406.08478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.066023Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:ac5a31618a8cb6f62fdd269e246547acc01ef69c9b42f6668b776770784ebc25","observation_id":"a10dd858-9346-4875-933a-7566f1fd5aac","resolution":{"observed_at":"2026-08-06T18:24:52.066023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10253","last_updated":"2023-12-28T03:44:28Z","snapshot_observed_at":"2026-07-06T16:08:13.029564Z","submitted_at":"2023-08-20T12:43:52Z","title":"StableLLaVA: Enhanced Visual Instruction Tuning with Synthesized Image-Dialogue Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10253","snapshot_observed_at":"2026-08-06T18:24:52.156204Z","title":"Stablellava: Enhanced visual instruction tun- ing with synthesized image-dialogue data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.156204Z"},"links":{"cited_paper":"/paper/2308.10253","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:526bb2c89012b47053ae1be523f0b81eff773ab92c56232b2cb2c43df4822acc","observation_id":"e92f5ebe-1327-4337-bc68-0d2a152b7e54","resolution":{"observed_at":"2026-08-06T18:24:52.156204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.683170Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":"c2398517-2907-4557-b3e2-cccf7e5bf8cc","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.337217Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:68661a093dbc27b0b06e7c596168ea501d0fd496435d88c9ca4c671e41ddb0ed","observation_id":"b9b3ccb0-a351-44e7-9cea-820c995e8ae4","resolution":{"observed_at":"2026-08-06T18:25:19.687602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:52.445832Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.445832Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:c30eccd5c6e33983fda1eae0e3e0b65cd5c6c39132d84db0850f4cab13a943c7","observation_id":"f35e224e-dd1e-4a27-b02c-93a3aee0d20e","resolution":{"observed_at":"2026-08-06T18:24:52.445832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.653837Z","title":"Visual spa- tial reasoning","venue":null,"work_id":"9718c6dc-1018-48fd-b72e-c91454ae3138","year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.521478Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:c80f4700826010097c8bf4bb0f176b0f02f850071dbb152a329e5e9cbdf9495c","observation_id":"814c3bba-122f-4c28-9e23-cae8c89f935f","resolution":{"observed_at":"2026-08-06T18:25:19.659790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.637416Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"9d582890-71c3-4490-a2c3-3ed3cff2d153","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.581229Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:14056e369dc61233387f1b7e8299780cd1e7b1e5fef07a2afad11444e04bb78f","observation_id":"42b1530c-475b-427e-a737-908dacbf949c","resolution":{"observed_at":"2026-08-06T18:25:19.642709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:52.651502Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.651502Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:70119de9509edef1939e0fe639bb1b68c56e5c627ebf62f9b618489732ce43b8","observation_id":"48815cf8-cfef-4993-a696-fbfce8c671f3","resolution":{"observed_at":"2026-08-06T18:24:52.651502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.612012Z","title":"Clevr-ref+: Diagnosing visual reasoning with referring ex- pressions","venue":null,"work_id":"0f66f4e1-3fd6-441c-bac6-4ac9214bb237","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.714850Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:019f17a2b1ae44e2102ff3c117289ba075820d2b3bff7b0d69174735c81edc97","observation_id":"4d370933-8331-4859-a900-570bb89c1077","resolution":{"observed_at":"2026-08-06T18:25:19.617137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20756","last_updated":"2025-08-11T14:20:55Z","snapshot_observed_at":"2026-08-04T05:33:48.921191Z","submitted_at":"2024-07-30T11:57:40Z","title":"SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20756","snapshot_observed_at":"2026-08-06T18:24:52.771144Z","title":"Synthvlm: High-efficiency and high-quality synthetic data for vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.771144Z"},"links":{"cited_paper":"/paper/2407.20756","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:fde80486bcfe698c73838b120057b10c26fc3f46452b39abe1488d6c52e66d49","observation_id":"0607d074-6d96-4b08-9d9c-b9ba782c61a4","resolution":{"observed_at":"2026-08-06T18:24:52.771144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:52.830815Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.830815Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:3476a15a1ae70f1326091bf983f1f3d3d0b416eb067146cc5c9c075e5b68c59f","observation_id":"ed303b27-b88d-462f-a43b-73855064240f","resolution":{"observed_at":"2026-08-06T18:24:52.830815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.584231Z","title":"Generating images with 3d annotations using diffusion models","venue":null,"work_id":"d68ecd94-508d-4f2b-85ea-69386474ac10","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.873041Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:5ff96e563fd4f8c664b3f9c0d9c981c971e462d93e9fd5454c72d554f38e9c10","observation_id":"ab1081b8-88ad-4e2c-802a-313c49b41b59","resolution":{"observed_at":"2026-08-06T18:25:19.588673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.565280Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"e7201d08-1e4d-4cdc-b5bb-5835278a8b98","year":2019},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.914267Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:af379266f909177be6aecca3254c0c104f5e367c23ee5ca3eef342d069fdc374","observation_id":"a6cd09cf-de71-4d48-9097-e578dad25472","resolution":{"observed_at":"2026-08-06T18:25:19.570935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.545236Z","title":"Llama 3.2 vision, 2024","venue":null,"work_id":"f8670a4b-3277-4ce3-a1df-6e15f944b6b9","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.948441Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:1f9edce58c1fd4b173429077a2490e5eb7b1140acbe16506d717202e791fc62a","observation_id":"4dd85980-213a-4cb5-871d-50e3964e5b8b","resolution":{"observed_at":"2026-08-06T18:25:19.552750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:52.982475Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:52.982475Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:ae6db0d6fd2d8103fe596cb66aa5285067b0c911c47c351f0595130c718955c8","observation_id":"c94a93ae-c02f-4e07-a0b7-2b79fc18a6e4","resolution":{"observed_at":"2026-08-06T18:24:52.982475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:24:53.028696Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.028696Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:7dd9d17fb4dace402950fce9b21cccdfacfa2dc47e308631db11e7d5562c1ae5","observation_id":"1ae0ea9c-8307-4059-b057-82dd1cdba90a","resolution":{"observed_at":"2026-08-06T18:24:53.028696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T18:24:53.060999Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.060999Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:3e4f018e22cadb27d47fbf518ad590dc36e6c08ee9b0ef5f64ee5955efd5d98e","observation_id":"1661cc17-f57a-44b8-b047-43babe783fc7","resolution":{"observed_at":"2026-08-06T18:24:53.060999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T18:24:53.119915Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.119915Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:2cdcf72b1d252a901b025faace867016117209a6caa863aa31e51f2991306e8d","observation_id":"ca9c2755-f9d7-435a-8a1f-717b50699f4e","resolution":{"observed_at":"2026-08-06T18:24:53.119915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.518427Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"b0c7cdbe-3070-4182-b49f-3f9e9fc4884b","year":2022},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.198135Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:3fa64d148265b69c5062b05ecc6ae9fdd5feffdc1b98d6ee33aa2e3cb5eef44f","observation_id":"4052a144-3fa7-4a01-a69c-8fa3c4b4411a","resolution":{"observed_at":"2026-08-06T18:25:19.524957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:53.303467Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.303467Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:ae2a4e16536eb82bbf05f2bf6e2e80fd37678f171aa3b178cf28a41e9f2ab9ae","observation_id":"dd505345-76be-404b-9b10-275b36819337","resolution":{"observed_at":"2026-08-06T18:24:53.303467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:53.390031Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.390031Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:b45c95598ac8a36178f8af6c5e0f490ecc72204689ee9479ff193136ab7c36d9","observation_id":"9875cc28-2f98-468c-a8d9-b47623ed61cb","resolution":{"observed_at":"2026-08-06T18:24:53.390031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07750","last_updated":"2024-06-07T12:10:47Z","snapshot_observed_at":"2026-08-04T21:07:04.374644Z","submitted_at":"2024-03-12T15:36:42Z","title":"Synth$^2$: Boosting Visual-Language Models with Synthetic Captions and Image Embeddings","version":2},"cited_work":{"arxiv_id":"2403.07750","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.07750","snapshot_observed_at":"2026-08-06T18:24:55.402733Z","title":"Synth$^2$: Boosting Visual-Language Models with Synthetic Captions and Image Embeddings","venue":"cs.CV","work_id":"3f39b854-1a17-4b27-9e53-146aafb0f685","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.424779Z"},"links":{"cited_paper":"/paper/2403.07750","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:52fd25453105b6bc3ddfd018c428881da41e73729f7c767d3f4ed50709b62fad","observation_id":"d002c5df-03fe-4763-a28f-23eee2621d6b","resolution":{"observed_at":"2026-08-06T18:24:55.438877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:53.489465Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.489465Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:69296cc974f18428d6ac46e983e606cec1eaca6878e97567c94fbe8ea9a6dfea","observation_id":"d4797100-dcb6-4087-bc71-4461a0599388","resolution":{"observed_at":"2026-08-06T18:24:53.489465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T18:24:53.538670Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.538670Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:52745391011ee3c734087b2391daf7b890583765300e8b485b759c4a0d05aed6","observation_id":"b8aa1ea9-f8e2-4318-9320-7e0eb3c59cde","resolution":{"observed_at":"2026-08-06T18:24:53.538670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-06T18:24:53.577193Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.577193Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:5753a1975af973bac9869961ed3c63f3c23c874ef5bf6b3133b3b3926b9e8193","observation_id":"c9d583e9-9e00-4bba-96a4-659e5838cd43","resolution":{"observed_at":"2026-08-06T18:24:53.577193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.438407Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"e49362eb-b7bb-4fa0-b66c-b0cc4c8195ca","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.637886Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:c738672d53f91e8a5da42e87e9be8b2e323f0184e6b012206d8d991e7dcca2e4","observation_id":"4b332fb1-d509-4478-b476-b450b80f5090","resolution":{"observed_at":"2026-08-06T18:25:19.451740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T18:24:53.692677Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.692677Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:7d0603ea4de6537eeef8dc933096dc26903dc2da6b4a370b172e24240e21e24e","observation_id":"57934c97-273e-42da-9534-3393f50de742","resolution":{"observed_at":"2026-08-06T18:24:53.692677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-06T03:52:00.226360Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-06T18:24:53.783559Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.783559Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:eb102a78e4f3bd3f1147d3eefb41ba83d1eff561aad0ac4f2ef09006e377ab15","observation_id":"0e37eb4b-4166-45b0-b6df-e75df5fd21a9","resolution":{"observed_at":"2026-08-06T18:24:53.783559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.406078Z","title":"Imagen editor and editbench: Advancing and evaluating text-guided im- age inpainting","venue":null,"work_id":"4eecbd52-441d-468d-857e-090be47a7e0d","year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.842559Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:15877fa684de65ced19d404c108723e6aaac46dd125f21162e4116ce489a3c74","observation_id":"8423d23e-82ee-47e6-9527-49274baf82e9","resolution":{"observed_at":"2026-08-06T18:25:19.419298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:25:19.380615Z","title":"Mebow: Monocular estima- tion of body orientation in the wild","venue":null,"work_id":"b4e2d86b-c6a6-4a6f-b4d1-57c9dfc7b6c8","year":2020},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:53.966799Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:25488a27c9cccbf16828f7d42170758b93e6dc1b12db3bd6bed67c911361df86","observation_id":"fd5b5f6f-9e11-4231-831c-620c733cfe23","resolution":{"observed_at":"2026-08-06T18:25:19.390347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:57.733599Z","title":"Beyond pascal: A benchmark for 3d object detection in the wild","venue":null,"work_id":"d7826fa3-e412-4c06-b836-7139e88cbdbf","year":2014},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.042393Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:180b62b21a9e578d55548a82204c260e9c7149be656fc904370b17de8bd4b1b5","observation_id":"03e92d3b-bf6b-4034-992f-3cc3dd659b52","resolution":{"observed_at":"2026-08-06T18:25:19.090317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:57.383092Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"9479ecdd-adaa-4d0a-88ba-6db78b36ff27","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.129706Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:5bf5364799032b59034007fa0979736c7c4e6d6f7456633a05c928dc275ec454","observation_id":"117e2623-f045-42d3-91da-bc5c6bedd6b6","resolution":{"observed_at":"2026-08-06T18:24:57.505282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-06T18:24:54.208155Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.208155Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:8fd8dd89ae835159be72c6bf0bc4cb7be403ba4672449c9fea7f102b7fc3b837","observation_id":"1a3ab2d6-e4ce-4703-be7f-c99d03379062","resolution":{"observed_at":"2026-08-06T18:24:54.208155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:54.285272Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.285272Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:90a50e2bb07147801047294fa1e6f2125af5c1acd54495df3e15138cb7d00009","observation_id":"6a79d9d7-e38a-465d-85c8-7c341d6176ed","resolution":{"observed_at":"2026-08-06T18:24:54.285272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:57.226310Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"889aee6e-22e7-4eec-aa79-39b4b4396bd4","year":2016},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.353308Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:e470f80590db86f5ffc98fbef736f6d63a453f3bbf8846b4ecf6714d9274c1b2","observation_id":"a1ae6438-1357-4865-a2aa-6fea4b191f89","resolution":{"observed_at":"2026-08-06T18:24:57.281558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01936","last_updated":"2023-03-23T23:21:38Z","snapshot_observed_at":"2026-08-03T09:40:32.201832Z","submitted_at":"2022-10-04T22:13:25Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01936","snapshot_observed_at":"2026-08-06T18:24:54.449939Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? arXiv preprint arXiv:2210.01936, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.449939Z"},"links":{"cited_paper":"/paper/2210.01936","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:4c37e2936d631d6c363501d87e8a0f0d451fb9e29824a970fe73fee9a0e2fa2d","observation_id":"720d82eb-b1da-4161-9cf6-1fba16e76b26","resolution":{"observed_at":"2026-08-06T18:24:54.449939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:57.108001Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"5df4317f-a317-4a5d-b502-19fc6f9f28f2","year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.528019Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:4a9645bfcc683fa5b31f418fb9a178cdb61eb1387d16a53d926beaff7f4ead7a","observation_id":"63f700ad-48dc-4077-98d8-270a195668c4","resolution":{"observed_at":"2026-08-06T18:24:57.170158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.982515Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"f8a320cf-14ee-46a5-ab54-088b9c0255eb","year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.606014Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:6bb9cd78202573776a01a1a2436ac621a7bceff239f47fd705379659c845cf41","observation_id":"8f26794e-2a13-4c39-9435-d62985f49828","resolution":{"observed_at":"2026-08-06T18:24:57.037280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-07-06T15:48:29.049336Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-06T18:24:54.680277Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.680277Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:c3f5052676b06ff8a2afa3ae683f5eb9d200cc743a8d09df9886cb5b9321ed3f","observation_id":"40b253b0-067d-4f80-b54f-90b17167e97a","resolution":{"observed_at":"2026-08-06T18:24:54.680277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T18:24:54.749240Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.749240Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:abb119b4cbfb9cf29d09c8d4c75cfc8cae3fe889e7ca7e7ce27cb0d6e869caf3","observation_id":"c59fd0ac-0659-49c7-88c2-f56a3efe1277","resolution":{"observed_at":"2026-08-06T18:24:54.749240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.856713Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"fa9304db-6483-4ed0-8c12-8ffdb4efd68c","year":2019},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.790724Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:a7810a96eeaf105c16e08e1c9d3f71900a6f335b8823f453a4cc6b459eaf5745","observation_id":"f97af725-1353-4477-a6e1-299e62af70b7","resolution":{"observed_at":"2026-08-06T18:24:56.904192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.773027Z","title":"Corresponding section in main paper is Sec","venue":null,"work_id":"043f8bb9-fab4-4c5d-adaa-05ad4a7fa3c2","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.830972Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:5cc90feb820ca382ad2cab89a921cbf831a453812d4ca8bdd0a47eebd4f5cf1f","observation_id":"7931a257-a464-4c0c-b3df-4fbbc23f9357","resolution":{"observed_at":"2026-08-06T18:24:56.816980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.703353Z","title":"front\" also means","venue":null,"work_id":"8894b8fb-676e-47eb-80b4-6053d91dd098","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.869213Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:38b5c170ab187ffbd66505da55e4b0d587c20ff14626c41ecadefaf63bf5666e","observation_id":"4260af33-793b-4be7-b525-314b47663afb","resolution":{"observed_at":"2026-08-06T18:24:56.728795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.606744Z","title":"SYSTEM_PROMPT_FOR_GRADING_MLLM_RESPONSE =’You are a helpful and precise assistant for checking the quality of the answer","venue":null,"work_id":"b27864cf-11ff-485c-824c-bbc616c1aee5","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.929420Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:5a58e97c598c46c44861028fdf314af09a8b19fb02329e6ea2b87076a2c7f4e6","observation_id":"662fd4c4-96c5-4aa1-a11b-8950e0b57382","resolution":{"observed_at":"2026-08-06T18:24:56.651563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.512832Z","title":"6, we show an example of using ImageReward [60] for the dataset curation by evaluating the alignment be- tween generated image and text prompts","venue":null,"work_id":"f51c4e60-e95f-4dc5-9e5c-631a933392cc","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:54.992499Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:fac084007dc2aed4c7c9265353bdb1543b6b9f649d650ac8ab9c96767dd87bbd","observation_id":"11274d10-18db-4291-b450-0af94b271366","resolution":{"observed_at":"2026-08-06T18:24:56.549201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.434611Z","title":"3, we perform quantitative comparisons on general image visual quality between different DM backbones: SD V1.5 and SDXL","venue":null,"work_id":"f0e8ceaa-591c-4bcd-bc0b-8efd6967ee6c","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.032116Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:336399573173ca073783c4c548671fe45d04edfa18e173ee637913acb54ff922","observation_id":"a833ed89-9c6d-4823-a8ec-80624261cff8","resolution":{"observed_at":"2026-08-06T18:24:56.468624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.368029Z","title":null,"venue":null,"work_id":"e42ad0e9-abba-49e3-b4d5-bdecf9ef9383","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.074253Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:04e8d892ba9ca2372c18cfde7d34069a4eca7c4f4bd2bfabc828dfd86f8b5e94","observation_id":"d8e97d91-b1ca-4777-87d7-625d4fce5795","resolution":{"observed_at":"2026-08-06T18:24:56.391242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.296290Z","title":"9 shows the UI page of our user study","venue":null,"work_id":"35cf2119-3372-4411-9d13-3c797fba4482","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.116586Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:9a452b845a93f6e77f17f94a05b77281f8fd6f748c3626ba2e495420189396a2","observation_id":"6fd6cb42-cbf1-427b-a8aa-f8f26501081d","resolution":{"observed_at":"2026-08-06T18:24:56.320779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.229556Z","title":"10 to show more qualitative comparisons between fine- tuned LLaV A model to commercial SOTAs","venue":null,"work_id":"f33126cf-6977-43e9-a32f-ca4b37885ff9","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.153359Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:c8d5ee96eafae3d9527def6596ae2118b43b3f95edad1482a1bac84633b04555","observation_id":"f80025b9-0df0-4d73-a614-011c00d5989c","resolution":{"observed_at":"2026-08-06T18:24:56.259557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.127267Z","title":"11, we shows more examples of diversity on object categories, camera-object relation, and background con- texts","venue":null,"work_id":"cce584e0-7e06-4304-9786-0d42c422b788","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.177843Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:6a01826eb3c9458a41a9c6ca7065851e7dc0e621191fb08cd5bb2e52d57593ee","observation_id":"ce8877c5-f5bf-41fc-b1a7-c7c842b22480","resolution":{"observed_at":"2026-08-06T18:24:56.181755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:56.047671Z","title":null,"venue":null,"work_id":"55d500b1-329c-49d5-88a0-3121b92bd089","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.205611Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:36437f06d5ed96d891a72383136aa25a3baa02795eeae7b67f3fa1c3abd9da63","observation_id":"7b09579b-8e9e-4749-9a60-76040f022433","resolution":{"observed_at":"2026-08-06T18:24:56.077268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:24:55.947647Z","title":null,"venue":null,"work_id":"0e0b49dc-f32f-4f2c-81df-3c32d2067d46","year":null},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:55.227295Z"},"links":{"citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:ca54272a2eedfd73d796c528c56da7424fb435aee47c88e85019f161e42f7c5f","observation_id":"ad2ed1f9-ff4d-4f55-9408-d2fbb7629d6e","resolution":{"observed_at":"2026-08-06T18:24:55.986032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","latest_version":2,"primary_category":"cs.GR","snapshot_observed_at":"2026-08-06T18:14:17.022825Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2507.08513."}