{"as_of":"2026-08-08T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b58efd69138f524df127bd36aa6c82bc4c390b85394f50c78d22d9eaa633926a","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:35:47.354401Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05440/citation-record","integrity":"/paper/2506.05440/integrity","json":"/paper/2506.05440/citation-record.json","paper":"/paper/2506.05440"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.16640","last_updated":"2024-07-18T09:01:52Z","snapshot_observed_at":"2026-07-06T18:20:09.790181Z","submitted_at":"2024-05-26T17:31:21Z","title":"A Survey of Multimodal Large Language Model from A Data-centric Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16640","snapshot_observed_at":"2026-08-07T10:35:40.086587Z","title":"A survey of multimodal large language model from a data-centric perspective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.086587Z"},"links":{"cited_paper":"/paper/2405.16640","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:0d7320fe2739ef8bb7356e88eec72ac97abc1f208a0aef445512aed3f3b507b0","observation_id":"f6605ebf-5760-41ff-8d5f-207cf9fa725f","resolution":{"observed_at":"2026-08-07T10:35:40.086587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:56.389836Z","title":"Understanding the limits of vision language models through the lens of the binding problem,","venue":null,"work_id":"aafe3029-6d15-45d3-b824-1917e157fa5e","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.159257Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:56fe2420ea79187b1e17640474b2d40a1f23b004c2e8efee14211ed90d7c7d09","observation_id":"798ada72-7bba-43f2-b70f-b9c6fd8f1891","resolution":{"observed_at":"2026-08-07T10:35:56.466850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:56.242422Z","title":"Vision language models are blind,","venue":null,"work_id":"f90d3928-3b05-4585-8e29-6f7eb01668be","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.177234Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:530b132b34cf412d298569aa9f38413f4b9beb4545e2e9eb4761e37b804cce90","observation_id":"7f9318cc-ccdc-47cf-adaf-5f451659b3aa","resolution":{"observed_at":"2026-08-07T10:35:56.314770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15563","last_updated":"2025-02-21T16:24:10Z","snapshot_observed_at":"2026-08-07T17:58:07.971664Z","submitted_at":"2025-02-21T16:24:10Z","title":"Bridging vision language model (VLM) evaluation gaps with a framework for scalable and cost-effective benchmark generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15563","snapshot_observed_at":"2026-08-07T10:35:40.241722Z","title":"Bridging vision language model (vlm) evaluation gaps with a frame- work for scalable and cost-effective benchmark generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.241722Z"},"links":{"cited_paper":"/paper/2502.15563","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:fbb224552914f145f5e0583fd7fca6739ca8e189bbbdc0b2bb31ca481387d1e4","observation_id":"8e4113d0-fc0c-4237-9c6b-e888e47cdaff","resolution":{"observed_at":"2026-08-07T10:35:40.241722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:56.071661Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models,","venue":null,"work_id":"23b26b9b-6b1e-4163-9b06-4540d1208c35","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.431645Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:8e5a06ad5f4286a4512b989764a04ae045ba61502eb3d655b11e66e9efb531c9","observation_id":"918d0586-7f49-4275-99ac-26ebcfd182cd","resolution":{"observed_at":"2026-08-07T10:35:56.145205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04810","snapshot_observed_at":"2026-08-07T10:35:40.558440Z","title":"Unibench: Visual reasoning requires rethinking vision-language beyond scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.558440Z"},"links":{"cited_paper":"/paper/2408.04810","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:e9b09331802046b62ec96336f1fc094dfb63bedee37545e5ed64f1b850ae550d","observation_id":"9771b082-b0d9-4e98-a987-f8f79d71e0b5","resolution":{"observed_at":"2026-08-07T10:35:40.558440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-07T09:14:56.498818Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-07T10:35:40.742944Z","title":"Mme-survey: A comprehensive survey on evaluation of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.742944Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:4d1164a98a9fa6e7066249211a9fc5876d87c85cd43873c00a2bbdfbfbba73ab","observation_id":"8a236e54-b53d-4350-96ea-4fa5bbd5bdf2","resolution":{"observed_at":"2026-08-07T10:35:40.742944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-07-06T20:16:27.318761Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-07T10:35:40.831220Z","title":"Benchmark evaluations, applications, and challenges of large vision language models: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.831220Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:73a8acd190cbf665372d9bd80162dcfeede56b09e32b4ea771da85e27c0ced2f","observation_id":"15fec2b0-8f47-4e75-8cd6-cc5e476f6d72","resolution":{"observed_at":"2026-08-07T10:35:40.831220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:40.936899Z","title":"Chatbot arena: An open platform for evaluating llms by human preference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.936899Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:38e059e8e78acc61765ec36e64c0b6ba631a1720ff25ea821955b07ce0502ac5","observation_id":"45644ae1-fae6-48d9-998e-b400adfe02e6","resolution":{"observed_at":"2026-08-07T10:35:40.936899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T10:35:41.061652Z","title":"Are we on the right way for evaluating large vision-language models?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.061652Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:a6252679929d3202edf204ef34f90aa153a42fe748adde68e0e0f08e26c3d000","observation_id":"1671100a-2f05-4f81-afdc-d5e48cd0d7d9","resolution":{"observed_at":"2026-08-07T10:35:41.061652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:55.883195Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":"ffc81107-6865-40cc-811b-35485550c92d","year":2022},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.158854Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:74e0f21a7921940695e54def007c7e037381c907cca1039d4e064dd382c65883","observation_id":"162f5834-9397-4106-a575-7443c5b65715","resolution":{"observed_at":"2026-08-07T10:35:55.963492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:55.694464Z","title":"Reproducible scaling laws for contrastive language- image learning,","venue":null,"work_id":"5a4d679a-0845-4a30-80c1-dc5d05e80d56","year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.263252Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:4e4293d5a610360ff11d5a792f779899661ed35c6dcbdb5b039e014e163e1f35","observation_id":"04a75bf2-b7eb-4506-850e-3d362dd4e933","resolution":{"observed_at":"2026-08-07T10:35:55.782803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:55.514496Z","title":"Mapping global dynamics of benchmark creation and saturation in artificial intelligence,","venue":null,"work_id":"eb63cba7-2dfc-4689-a127-ef4dd20516c4","year":2022},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.426121Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:1916d92897bcd6e91c6d1b1021d224d3e664f890d395c774c12c2b9e6a9094a1","observation_id":"eebbae27-2485-4fef-bf04-5ac753034236","resolution":{"observed_at":"2026-08-07T10:35:55.600956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:55.338851Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision- language compositionality,","venue":null,"work_id":"305a8c18-98d0-4162-b57a-4b8a4c36f17e","year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.511793Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:85e2d62697d754ca439aa125da97e09198ab66a55f616eac0a55fe2f7aae2176","observation_id":"7be181f3-e544-4f7b-9081-70c9b9536f2b","resolution":{"observed_at":"2026-08-07T10:35:55.414344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:55.192217Z","title":"Blender - a 3d modelling and rendering package,","venue":null,"work_id":"b6bbaf56-253a-44ab-9b84-bbb742c3a0a5","year":2018},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.636972Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:76042abfe630d6f509dc3ccc0754fbfda1b4b9fb1dd9cbea180122e1593cbb10","observation_id":"e514ba06-7d22-4451-b669-6cee76028f3f","resolution":{"observed_at":"2026-08-07T10:35:55.265725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:55.025067Z","title":"Is a picture worth a thousand words? delving into spatial reasoning for vision language models,","venue":null,"work_id":"8cdd0704-f018-4775-b7e4-ed4f928b8f94","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.736340Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:739904d7344f7a694d9ef3d731dc305f5b3e3d1c15f1c075a29b2478cabaa69d","observation_id":"637f5d01-345a-491e-bf80-7c2d8ca3673a","resolution":{"observed_at":"2026-08-07T10:35:55.111765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17600","last_updated":"2024-01-31T04:57:12Z","snapshot_observed_at":"2026-07-06T17:22:53.623679Z","submitted_at":"2024-01-31T04:57:12Z","title":"Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17600","snapshot_observed_at":"2026-08-07T10:35:41.868792Z","title":"Good at captioning, bad at counting: Benchmarking gpt-4v on earth observation data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.868792Z"},"links":{"cited_paper":"/paper/2401.17600","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:0aab55e20096ef1ef76f9b4a28dc46de8eb9738dabea4f3c78fad4a39375bf55","observation_id":"910cafb6-7591-4ee6-b69e-bc74298e466a","resolution":{"observed_at":"2026-08-07T10:35:41.868792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:54.858129Z","title":"Gpt-4.1, technical report,","venue":null,"work_id":"00e53855-1eab-4d70-807b-4c6311a6d807","year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.964786Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:8255c73ed139f2d5badb30538f8fe90798ceb021228a7a02207b1837ea51ef64","observation_id":"c4e5a6f5-c21c-49d0-b702-ec3f46dff493","resolution":{"observed_at":"2026-08-07T10:35:54.925232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:54.682699Z","title":"The llama 4 herd","venue":null,"work_id":"e94a6f88-5940-42b9-b0f7-72fb6dea1145","year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.040132Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:9c78a7099767124143414394224f630237a13b5c42420351ffec5de53aeeba21","observation_id":"a015eb3e-0c87-42fa-8231-ad83279b42e7","resolution":{"observed_at":"2026-08-07T10:35:54.763787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:42.138086Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.138086Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:1bf7f0ac9d6345f73a091479ba1b335d1c6094ac2cd2e04c497f932b221cf095","observation_id":"914a2a46-733e-489c-add6-3b10a3d2a725","resolution":{"observed_at":"2026-08-07T10:35:42.138086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:54.497731Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,","venue":null,"work_id":"83d721ac-48c9-4643-8941-cf67f0897720","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.225863Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:ca24b6f9b1a836d127a89149f159e2a518560c881b9f562b39bb8dc2912ffc5a","observation_id":"7cc571b9-2bde-4424-9621-7bbba127e374","resolution":{"observed_at":"2026-08-07T10:35:54.584548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T10:35:42.333123Z","title":"Mmbench: Is your multi-modal model an all-around player?,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.333123Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:186966462ecb785fc59e60721ff044f2fe5ef6be8efadd3dc8972c4ee0a94fc9","observation_id":"befd5ea0-e3ed-4888-9489-2620759315e3","resolution":{"observed_at":"2026-08-07T10:35:42.333123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:54.296873Z","title":"Towards vqa models that can read,","venue":null,"work_id":"3415c3a0-71aa-477e-b063-440fe2b0a95f","year":2019},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.437285Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:627baa52f60304b1c1e9f7490075c19479d9d2a7ab06c17efedd2d0ec9e48b64","observation_id":"eac71a37-6b61-4086-8b6b-49f56f195732","resolution":{"observed_at":"2026-08-07T10:35:54.377220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T10:35:42.526705Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.526705Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:a4b7e150e85d302a47b4c8f507c675d56d3bb159577f590b7adb9252b6f68924","observation_id":"9bf2c512-191e-4dd6-88b1-14c17ed52933","resolution":{"observed_at":"2026-08-07T10:35:42.526705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:42.639320Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.639320Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:b5cdbed0bc1c7faee0240061046aa776a11a534d4997ca6c393ddd2bfdbbfe0d","observation_id":"6cb976dd-c83a-4ef1-a2ea-d79b09f94e3f","resolution":{"observed_at":"2026-08-07T10:35:42.639320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:35:42.739222Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.739222Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:156fd11de3744833c76b886abd6ea83039438503bac658b3924a7893208cb99c","observation_id":"c9fe4d05-4ff3-4bef-90f8-08dae7389772","resolution":{"observed_at":"2026-08-07T10:35:42.739222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T10:35:42.968424Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.968424Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:73916b393eb75fdf048c4305fe873d7ed9400c67edca20ffbec27b9f4da42869","observation_id":"83aee8e2-3d05-4441-911c-1dc9bd8deac6","resolution":{"observed_at":"2026-08-07T10:35:42.968424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:35:43.079240Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.079240Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:61bf6de22b886545956ef9dc1a20cbd2c734e7c1672c83fce8f5861247f4209a","observation_id":"3a6e5bd1-65ee-44e7-8efc-7b10b5a64350","resolution":{"observed_at":"2026-08-07T10:35:43.079240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18923","last_updated":"2025-08-13T17:44:18Z","snapshot_observed_at":"2026-08-07T16:40:29.716914Z","submitted_at":"2025-03-24T17:46:09Z","title":"Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18923","snapshot_observed_at":"2026-08-07T10:35:43.167178Z","title":"Video simpleqa: Towards factuality evaluation in large video language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.167178Z"},"links":{"cited_paper":"/paper/2503.18923","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:66138f5285a7c276d013683cd1ee9ccedec4fa6765136f2eac0ebe20d3457ea0","observation_id":"bef3366d-d986-4a23-ad57-4dd43c100369","resolution":{"observed_at":"2026-08-07T10:35:43.167178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:43.253445Z","title":"Inst-it: Boosting multimodal instance understanding via explicit visual prompt instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.253445Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:0543cf619d5423956715980809947ff4603afa64ece53d5b72729a096fe9d3a1","observation_id":"76b335eb-4e55-4c8a-8f85-d8fcba66c3b4","resolution":{"observed_at":"2026-08-07T10:35:43.253445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:43.336669Z","title":"Lvlm-count: Enhancing the counting ability of large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.336669Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:e3757e79810ca864d4e03c67b19255f779a13f385f89cff08ce8c9bd0858037c","observation_id":"d5dd899c-b52d-40f1-970e-71f55c8f0382","resolution":{"observed_at":"2026-08-07T10:35:43.336669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:54.116530Z","title":"Countgd: Multi-modal open-world counting,","venue":null,"work_id":"cd5557d6-1d25-46bc-b52f-2d5f9c02a50a","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.450268Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:f2401f5bf7e87515b29f8f55ed275d6aa3ef99a860ca832cfb85cc6f213f491a","observation_id":"2346d8d3-942b-4089-a9a4-0944cc30390e","resolution":{"observed_at":"2026-08-07T10:35:54.198197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:53.903272Z","title":"Mutually-aware feature learning for few-shot object counting,","venue":null,"work_id":"fd81e9e3-d318-4207-b02f-253f182d2c8c","year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.534416Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:4a01c7c6caa3427f0dc2c52baa6e35a96e977991e38f8fa73ac8166b6c8085f8","observation_id":"2c341945-1a06-40ae-b78b-f6d0eb76d961","resolution":{"observed_at":"2026-08-07T10:35:54.011104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:53.679202Z","title":"Point segment and count: A generalized framework for object counting,","venue":null,"work_id":"ad518e1a-bed9-4015-a913-267ecbe9e846","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.622316Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:7560ca5ebff1b50e4edf46439e726be7a71f7d2a5bc12ebf16d2ac3226ecb1e4","observation_id":"8c0c95e2-0056-4772-b6f7-f7940a896872","resolution":{"observed_at":"2026-08-07T10:35:53.787828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19707","last_updated":"2025-03-25T14:34:06Z","snapshot_observed_at":"2026-08-07T16:38:11.702011Z","submitted_at":"2025-03-25T14:34:06Z","title":"Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19707","snapshot_observed_at":"2026-08-07T10:35:43.691323Z","title":"Mind the gap: Benchmarking spatial reasoning in vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.691323Z"},"links":{"cited_paper":"/paper/2503.19707","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:775d3f4e3953a8e32a32ae629cf582eff82be9f04b6390fab4bcfe83581bab37","observation_id":"0cd3df1a-b09a-4cb4-b3a5-a6eaa402bac7","resolution":{"observed_at":"2026-08-07T10:35:43.691323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:53.515146Z","title":"Tallyqa: Answering complex counting questions,","venue":null,"work_id":"ea30cef6-3296-4866-afe0-7db054336b20","year":2019},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.763071Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:06880a898994d83ffbe0a0a58f22ecd39092177325338030daf7bd175aabc17b","observation_id":"332a7eb4-7a85-4d22-99b8-daabd9206de5","resolution":{"observed_at":"2026-08-07T10:35:53.589079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:53.354072Z","title":"Counting everyday objects in everyday scenes,","venue":null,"work_id":"68394d44-817a-4251-af35-746884938174","year":2017},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.840002Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:63165fc8e99411a744819da38b894b29b5f77a1359486f1cd3a6001e4c20226f","observation_id":"ffd9d218-205a-4628-9721-cc2eae846a7c","resolution":{"observed_at":"2026-08-07T10:35:53.434334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:53.135771Z","title":"Pixel-wise crowd understanding via synthetic data,","venue":null,"work_id":"c4c3f3bf-c6a2-4a1c-8ccd-f2aaf4fa9a9f","year":2021},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.933217Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:07ecc3fa01a16333d5f3cca609dc2202669af720f8b0ced4d118099c55d87379","observation_id":"11207b17-0230-4abb-8952-74b945e601ff","resolution":{"observed_at":"2026-08-07T10:35:53.240946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:52.935362Z","title":"Nwpu-moc: a benchmark for fine-grained multicategory object counting in aerial images,","venue":null,"work_id":"f40d564f-54cc-4c3d-b43a-c7b9f1941ec4","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.029175Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:1b5f89c22f1e685cc992cc7ad9ca96822ec92080e8c38ed8d665ab1498c3e212","observation_id":"2db4891d-c71b-4b55-a394-126750cb2bec","resolution":{"observed_at":"2026-08-07T10:35:53.030822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06048","last_updated":"2024-11-09T03:07:33Z","snapshot_observed_at":"2026-07-06T19:47:47.232714Z","submitted_at":"2024-11-09T03:07:33Z","title":"An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06048","snapshot_observed_at":"2026-08-07T10:35:44.119016Z","title":"An empirical analysis on spatial reasoning capabilities of large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.119016Z"},"links":{"cited_paper":"/paper/2411.06048","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:181f069a4d396c66222ecb68ae060eb982f0c7595f1fa7c26d089ce419291189","observation_id":"0ea5f7f5-25b9-4990-8352-8fe4af0d8431","resolution":{"observed_at":"2026-08-07T10:35:44.119016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-07-06T18:24:38.958815Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-07T10:35:44.249542Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.249542Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:3e1665826b54e082d627c4d4181cc0ef5839f57b09bd62e745fdbd23d284dede","observation_id":"61d2f55d-3e29-4091-92b3-383a5c5938ae","resolution":{"observed_at":"2026-08-07T10:35:44.249542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21259","last_updated":"2025-03-06T03:31:32Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:55:08Z","title":"AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21259","snapshot_observed_at":"2026-08-07T10:35:44.349157Z","title":"Autobench-v: Can large vision-language models benchmark themselves?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.349157Z"},"links":{"cited_paper":"/paper/2410.21259","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:a1c8ce1efd8c60aad63dbac633370390f394e240b0ae9c94f73a3deab0865ea7","observation_id":"ef369034-fb0f-4a96-8549-ffb33799306d","resolution":{"observed_at":"2026-08-07T10:35:44.349157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11631","last_updated":"2024-01-21T23:54:05Z","snapshot_observed_at":"2026-07-06T17:18:32.330256Z","submitted_at":"2024-01-21T23:54:05Z","title":"Text-to-Image Cross-Modal Generation: A Systematic Review","version":1},"cited_work":{"arxiv_id":"2401.11631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.11631","snapshot_observed_at":"2026-08-07T10:35:47.718916Z","title":"Text-to-Image Cross-Modal Generation: A Systematic Review","venue":"cs.CV","work_id":"7ab72ceb-9bf9-4eff-b22e-c92fa193a826","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.443168Z"},"links":{"cited_paper":"/paper/2401.11631","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:3e88dc22dc57abab29bdadc2b11cb8c15cfd7325c224386b2ee2dd5ee38db486","observation_id":"823ada39-8eba-41a3-8437-542e6c3aacf1","resolution":{"observed_at":"2026-08-07T10:35:47.774922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-07-06T17:23:26.913214Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-07T10:35:44.536971Z","title":"A survey on hallucination in large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.536971Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:71c2888fafd7f4354b87e10da057096d7318683fdc919b1084bde442770cfe41","observation_id":"89735524-0b96-4f22-8318-7b852d34b7ce","resolution":{"observed_at":"2026-08-07T10:35:44.536971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11775","last_updated":"2025-01-27T06:25:11Z","snapshot_observed_at":"2026-08-07T07:54:21.393889Z","submitted_at":"2024-06-17T17:32:42Z","title":"Task Me Anything","version":2},"cited_work":{"arxiv_id":"2406.11775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11775","snapshot_observed_at":"2026-08-07T10:35:47.544677Z","title":"Task Me Anything","venue":"cs.CV","work_id":"4b08a860-3166-48df-9713-31603a28fcbf","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.636749Z"},"links":{"cited_paper":"/paper/2406.11775","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:30d1c05a5b1a26977f17e4fa21fd9b8caa950fd57219f7e536f8e739c9bd3e28","observation_id":"54da10d8-9089-4e01-a6e2-12d0846bc6e2","resolution":{"observed_at":"2026-08-07T10:35:47.618630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07012","last_updated":"2024-12-29T03:52:23Z","snapshot_observed_at":"2026-08-04T06:34:17.337678Z","submitted_at":"2024-12-09T21:44:02Z","title":"ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07012","snapshot_observed_at":"2026-08-07T10:35:44.712242Z","title":"Provision: Programmatically scaling vision-centric instruction data for multimodal language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.712242Z"},"links":{"cited_paper":"/paper/2412.07012","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:1bebdbec7652629842fe26c59eef0c887014ca1c1e1015bf0951a6995b10d16e","observation_id":"816c111e-c13c-4b08-a45c-7ce7ba3fbb20","resolution":{"observed_at":"2026-08-07T10:35:44.712242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:52.716626Z","title":"A new benchmark: On the utility of synthetic data with blender for bare supervised learning and downstream domain adaptation,","venue":null,"work_id":"8b1a83c1-ef23-4837-a647-bc57de056339","year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.798631Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:9cab5b8be92940fd1cde450218a763fd78047e89ba42af0c2d5d0b158a0c4dd8","observation_id":"80a0f0c5-2036-4c6f-85be-c78e0e6a84f2","resolution":{"observed_at":"2026-08-07T10:35:52.822487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-07T23:47:53.537198Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-07T10:35:44.870369Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.870369Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:f117c60c96c7e10b37a38a834b903a1e579e1d25e13fabf22faf9400587a6e19","observation_id":"feb10324-1938-47ff-a4ff-fc8f6981218f","resolution":{"observed_at":"2026-08-07T10:35:44.870369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:52.514968Z","title":"A survey of synthetic data augmentation methods in machine vision,","venue":null,"work_id":"1ccb59a1-df57-4ace-82b5-362477ddf003","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.941184Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:b24eb5fc4f3b3d917b4176008a9f8f6d8a9349fe896fdbda30264207126c02a0","observation_id":"44e4c400-def7-4953-afee-b2e14ea5c6b2","resolution":{"observed_at":"2026-08-07T10:35:52.600624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16411","last_updated":"2025-01-29T03:52:39Z","snapshot_observed_at":"2026-08-02T23:35:21.038166Z","submitted_at":"2025-01-27T18:59:58Z","title":"PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16411","snapshot_observed_at":"2026-08-07T10:35:45.016934Z","title":"Physbench: Benchmarking and enhancing vision-language models for physical world understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.016934Z"},"links":{"cited_paper":"/paper/2501.16411","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:3006a9ba6325436f184d6bef1189087f87b0a7d380e3cb015dcec7eca43c96fd","observation_id":"436010c1-1f0f-436c-b484-c25ccb20e378","resolution":{"observed_at":"2026-08-07T10:35:45.016934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13543","last_updated":"2025-04-01T14:45:22Z","snapshot_observed_at":"2026-08-07T21:22:03.988482Z","submitted_at":"2024-11-20T18:54:32Z","title":"BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13543","snapshot_observed_at":"2026-08-07T10:35:45.109989Z","title":"Balrog: Benchmarking agentic llm and vlm reasoning on games,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.109989Z"},"links":{"cited_paper":"/paper/2411.13543","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:029f9d7fa40a9eed8829eafec2786154130ae95ede4c4d14df1b4a211f4ebac4","observation_id":"1309fa9b-8503-40c2-9b3a-5df24b3b0822","resolution":{"observed_at":"2026-08-07T10:35:45.109989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:52.353947Z","title":"Mistral small 3.1","venue":null,"work_id":"a567e05e-cf3d-444f-8839-4c3be46afd1b","year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.202319Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:3c036980f2a6e05fa478e0aee0b711ab7b3013005e84607373b34c4e90496b65","observation_id":"5777d1c2-26d9-4cd0-a2f6-e16c98c6cd54","resolution":{"observed_at":"2026-08-07T10:35:52.424049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T10:35:45.263462Z","title":"Gemma 3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.263462Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:6c04ea0826bc3122000d00bea1d61186976e1f778293b589ae5c44f6744ff518","observation_id":"86609e18-cab3-47a0-b940-6f4bf3136bd3","resolution":{"observed_at":"2026-08-07T10:35:45.263462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:52.175034Z","title":"Llama 3.2,","venue":null,"work_id":"9df212ff-cca6-439d-bef7-10d2fb7eb7ff","year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.395650Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:82099ab3c3989e43935f73580e7a9eb10534c236d80b67f9a75ce8ec39d84779","observation_id":"9c685f14-5840-4255-8c6e-953948571938","resolution":{"observed_at":"2026-08-07T10:35:52.256547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:35:45.491843Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.491843Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:196ef33edefab484d096e50b97396ba46879bd8d2874ab6eaaff857f75b0fc59","observation_id":"07d4cc45-0d05-423d-9c60-cbc933a7ab9c","resolution":{"observed_at":"2026-08-07T10:35:45.491843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:51.952553Z","title":"Mapping global dynamics of benchmark creation and saturation in artificial intelligence,","venue":null,"work_id":"6d55aba5-dbd8-4c50-957b-ac304dd69a8b","year":2022},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.588423Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:3bcd07154d3c5d6ab9215860b14b84baa58534f5f2bc8e466af0d2ff4393b5eb","observation_id":"49732c18-27a4-4994-a5ca-36b5f169232d","resolution":{"observed_at":"2026-08-07T10:35:52.093931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12990","last_updated":"2024-11-20T02:38:24Z","snapshot_observed_at":"2026-07-06T19:52:55.369337Z","submitted_at":"2024-11-20T02:38:24Z","title":"BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12990","snapshot_observed_at":"2026-08-07T10:35:45.662254Z","title":"Betterbench: Assessing ai benchmarks, uncovering issues, and establishing best practices,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.662254Z"},"links":{"cited_paper":"/paper/2411.12990","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:bf9060a81fcde004737e60856882a50a1734b989eefa5f9f1f3617c87d9835a5","observation_id":"ceeea004-4522-4026-a064-3187b96cf508","resolution":{"observed_at":"2026-08-07T10:35:45.662254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:51.699801Z","title":"Hypersim: A photorealistic synthetic dataset for holistic indoor scene understanding,","venue":null,"work_id":"6d319139-1512-45fc-844a-58ffe72bf543","year":2021},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.743564Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:a1bb76213d1b97827b0c99c1e95c35b9e61c81edff441f7cbe778155e2d45ad6","observation_id":"3fee4364-e1ed-499b-b648-7b78947c080b","resolution":{"observed_at":"2026-08-07T10:35:51.802884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:51.516056Z","title":"Blenderproc2: A procedural pipeline for photorealistic rendering,","venue":null,"work_id":"98091cd3-688a-4dcc-887b-9c3c06c630c5","year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.839830Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:2c41efbda605f6c5c08bd5513fbec46594caf4bfe4b4686bf0c5d94b9adbe26a","observation_id":"8b25eb22-564f-4091-ae8d-e13710a38801","resolution":{"observed_at":"2026-08-07T10:35:51.622054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:51.314076Z","title":"Chain-of- thought prompting elicits reasoning in large language models,","venue":null,"work_id":"53fd9599-968e-4c60-aa1d-88a86a4564d6","year":2022},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.958601Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:afd74320de3c008f18761686349b6ec013254373d1a27e647485887b55864297","observation_id":"b47f366a-5f70-4f68-9b28-f2a57c844510","resolution":{"observed_at":"2026-08-07T10:35:51.403411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:51.139454Z","title":null,"venue":null,"work_id":"929c2044-19ac-464f-9437-9a7c930bd234","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.051142Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:dd35a3175c496883d3a663e946044ec2b066f035eb182fdcdda93bd52ec17d02","observation_id":"e72e3bfb-d623-4c35-b677-bf78f7bfb926","resolution":{"observed_at":"2026-08-07T10:35:51.221846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:50.919264Z","title":null,"venue":null,"work_id":"58d2c27a-2fd9-4138-a592-0b49b034132f","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.151798Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:35443ff09da3b5a3cb6b97a7b5971703d8921bfda1a3e2785e5cfa266cf800f1","observation_id":"74083242-191c-457c-b57f-e3e08d747067","resolution":{"observed_at":"2026-08-07T10:35:51.026369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:50.711550Z","title":null,"venue":null,"work_id":"ab251215-400b-40ce-8e9e-ecacc7ebc95a","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.265895Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:5ca9cb67f2c84d8e820ee83cdddd57ed258f186797314fb9177b93f5b06c8a2a","observation_id":"52fbb103-68ee-4980-9796-5c2d496162a2","resolution":{"observed_at":"2026-08-07T10:35:50.802898Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:50.336721Z","title":null,"venue":null,"work_id":"39d18b7d-9de2-44a7-a355-7430093df0c7","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.352110Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:788545979d94286e176f13cbe4a706287b669eae5776adf80d345c8cd1eee7cb","observation_id":"f7d78d32-2fb2-447f-abca-f06843419468","resolution":{"observed_at":"2026-08-07T10:35:50.596450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:49.861146Z","title":"The number of pieces in the image is:","venue":null,"work_id":"da35c02e-cf3f-424d-b3ee-4a0bcfd5a1c7","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.462367Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:300cfd15e0e2c744c72182e230275c0aaa0c49a835429809afbb9ab2e83031c7","observation_id":"85f99d90-d911-4c2e-a058-9c655de839cb","resolution":{"observed_at":"2026-08-07T10:35:50.084264Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:49.581577Z","title":null,"venue":null,"work_id":"6262fbfb-8d1d-4c7d-990a-37e725a53d56","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.555286Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:761b4f7c9f8f6708a25caa189e72a94e9355e75da80484a41fd6fb3983d52b0f","observation_id":"ad7a809f-4d1f-4aa6-afa6-b115628456b3","resolution":{"observed_at":"2026-08-07T10:35:49.717958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:49.360861Z","title":null,"venue":null,"work_id":"cf73414a-0e4d-4952-b0f6-31765b2555aa","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.700401Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:8c83635fccfec2b2bdc1ced592d91b58b4c241bb3f52e37dad923840d4340a26","observation_id":"c18c16d5-c1fa-4e08-93e7-5c39fb09c8e0","resolution":{"observed_at":"2026-08-07T10:35:49.437797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:49.197749Z","title":null,"venue":null,"work_id":"b41e64be-a3ff-4332-a362-b2176564e00a","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.780680Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:5c40e98fcc66aebc70eea2bf4c97680de48162d3bae9cc141c3b55fc7c617f2c","observation_id":"35149dde-52d6-4daf-ba1f-4fd8c8821565","resolution":{"observed_at":"2026-08-07T10:35:49.271660Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:49.035610Z","title":null,"venue":null,"work_id":"78d2f9f8-d0a9-497d-b0f3-74c07bb7f639","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.867764Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:a8d95734428db145ece9aba491e9ee63868d7c5a858c73841093556eae27f5f0","observation_id":"043c2210-f07d-4cd5-ab43-a5debabaae8e","resolution":{"observed_at":"2026-08-07T10:35:49.101727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:48.854632Z","title":"base_pile_config","venue":null,"work_id":"7108b422-d949-4fe4-8b62-db54f23ae4ef","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.962466Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:11b608b9f601778ef1705b3b73f835d1d766348e5d1f26e019d376d1d841c4cc","observation_id":"203d8c50-9dde-4cfd-95cc-7b73e850ef25","resolution":{"observed_at":"2026-08-07T10:35:48.957617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:48.660907Z","title":null,"venue":null,"work_id":"0b645b58-f5eb-46ef-b9a6-8f88d9bb2da7","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:47.032695Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:141d3728bb5ddc643f527b02ea6a020219671c9e6835b46efadc0ff8676995b2","observation_id":"c8be7de6-96ee-4304-bf8a-6d2b47a710e5","resolution":{"observed_at":"2026-08-07T10:35:48.729607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:48.471669Z","title":null,"venue":null,"work_id":"b0f9a994-9fa0-4734-9cd3-b0be1755e230","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:47.126972Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:0acc7b99a42d1aa34079ecc4ca5b68631b72eaa2562df9a23aeb32bd3df52cf5","observation_id":"dfdb1b10-7a28-4e95-a9da-2ef007d99477","resolution":{"observed_at":"2026-08-07T10:35:48.560472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:48.312664Z","title":null,"venue":null,"work_id":"979655fd-9b81-4ff7-aa5c-27345b3b090c","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:47.228549Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:e2dbd6b3f932821e6f16132d933add937097c568830a3368591ac46e539bf41a","observation_id":"b00bbe77-9d72-47ef-9626-39c7706fe46f","resolution":{"observed_at":"2026-08-07T10:35:48.380569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:48.168405Z","title":null,"venue":null,"work_id":"2da2b814-67de-45f2-ab56-45eb961bb6e8","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:47.354401Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:1db5ef830fb51950f8f0af93b54b8b9a3780bc4b425bc0a005e5c1f6d4e8c615","observation_id":"2ecdd454-bcc9-4298-aa46-4a2174b5754a","resolution":{"observed_at":"2026-08-07T10:35:48.221264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2506.05440."}