{"as_of":"2026-08-07T05:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb2e7beb40c8a0d39bfbb21d39fdd489ae8e4817ed5f84be9a4a00063e7b9b76","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:51:28.030074Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12441/citation-record","integrity":"/paper/2507.12441/integrity","json":"/paper/2507.12441/citation-record.json","paper":"/paper/2507.12441"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-06T16:51:22.229917Z","title":"Phi-4-mini technical report: Compact yet powerful multi- modal language models via mixture-of-loras","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:22.229917Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:7dfa4cce95f1743c592241627542b06081a98458ae497067af4b2ccbfa5d35fb","observation_id":"84beee77-f1d4-4035-a9b7-5f7201e7181c","resolution":{"observed_at":"2026-08-06T16:51:22.229917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:22.309488Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:22.309488Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:21ef8a162ca592077eb47b15a912e32dd1f6ab9f69ce6d87d7f33ef1915a1dba","observation_id":"79bac547-d27f-430e-944b-1006cabfc0d4","resolution":{"observed_at":"2026-08-06T16:51:22.309488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:32.855917Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"1d30ef70-ae12-4c14-9b8c-dacea283941d","year":2015},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:22.463704Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:2aaa77a86f0c52930fa9a19bac94357ed9d85db45d04cd925e42da7cd7240a2f","observation_id":"7c81a785-24f2-415b-bfa1-4e5fd412585c","resolution":{"observed_at":"2026-08-06T16:51:32.933048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:32.732943Z","title":"Manmatha","venue":null,"work_id":"25d1dd19-6b43-4480-b0a9-fe513e78b181","year":2021},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:22.554582Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:65b2f86b61bd7fd5d938c098c4d24745dac54112690b1730d51d0f5c972359dc","observation_id":"e9cc3a14-c47a-477e-8694-381b28179564","resolution":{"observed_at":"2026-08-06T16:51:32.796643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:32.570935Z","title":"Manmatha","venue":null,"work_id":"b6c9acfd-950c-417e-a58a-543d13d97d67","year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:22.656721Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:5f70b4f6ea48579b9087b865d9f3cf3317457be8583bd865449d827272bba66d","observation_id":"8a470535-b176-4f33-94f3-45f224946407","resolution":{"observed_at":"2026-08-06T16:51:32.663645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T16:51:22.733714Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:22.733714Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:4bdd95e1fe00bd04a95446e0d727f07ea64eb88bee96c6e0fde2f18447e36d92","observation_id":"d8d2a888-5a6f-4ff0-9ad3-e569c7f39201","resolution":{"observed_at":"2026-08-06T16:51:22.733714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07654","last_updated":"2022-10-26T10:47:17Z","snapshot_observed_at":"2026-08-07T05:19:38.977998Z","submitted_at":"2022-02-15T18:53:58Z","title":"Tomayto, Tomahto. Beyond Token-level Answer Equivalence for Question Answering Evaluation","version":2},"cited_work":{"arxiv_id":"2202.07654","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07654","snapshot_observed_at":"2026-08-06T16:51:28.744178Z","title":"Tomayto, Tomahto. Beyond Token-level Answer Equivalence for Question Answering Evaluation","venue":"cs.CL","work_id":"77de9f7d-d1a7-483a-b440-1c4f8cc2e490","year":2022},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:22.802127Z"},"links":{"cited_paper":"/paper/2202.07654","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:afbf9e87925ab385093b40d25c3db43249a3d4cfc1fba69add5ed4a7fc5e8eb5","observation_id":"344dca3c-927f-4deb-86dc-f41c4a3ea717","resolution":{"observed_at":"2026-08-06T16:51:28.793646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:32.408328Z","title":"Meyer, Yuning Chai, Dennis Park, and Yong Jae Lee","venue":null,"work_id":"c3aff72e-56e9-40ea-b9b9-984d338c5d96","year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:22.923107Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:85ff946459501d84493f64ba47defb0fe799d7a54ef4015476de92ff376f2dd5","observation_id":"4ad8f5d5-e9bb-415d-b736-ca6e5a7cb673","resolution":{"observed_at":"2026-08-06T16:51:32.487993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T16:51:22.997706Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:22.997706Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:f5f6bda1fe4851be02058ae06658a467dc199cfca9a091956d9e060e4452f367","observation_id":"bf59f0d9-51d7-4de1-9dc9-850e09d2d67b","resolution":{"observed_at":"2026-08-06T16:51:22.997706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T16:51:23.059337Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.059337Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:c3c0c4064a7591f479434fc43121d93e380655368ac13f6633cf9b538824618c","observation_id":"24af260d-1cfe-4dfd-a9b9-c4cffd26ca9c","resolution":{"observed_at":"2026-08-06T16:51:23.059337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T16:51:23.141636Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.141636Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:87608e616340b00ebb2ad0899a85a97c4ac5d78455aff3859ed3f32f89408026","observation_id":"c2a536a4-87fd-4d88-82a1-083890949eaf","resolution":{"observed_at":"2026-08-06T16:51:23.141636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-08-06T16:51:23.196657Z","title":"Scalable vision language model training via high quality data curation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.196657Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:0117d9102071bcf89a83bff2f4b89d1b00d2b88309b64e3bcc537eac2d96f60f","observation_id":"e726fda4-961a-49f9-9f94-11b812202f0d","resolution":{"observed_at":"2026-08-06T16:51:23.196657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:32.272016Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"5437e9e6-7c37-4e96-9224-d02c0452226f","year":2017},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.241332Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:16f06a25ab88a5daa68d2bf0438478c160dc52c53300491ee2e89683f9e573c1","observation_id":"1b8edb5d-19a6-4eb7-9eef-0f7e89541c57","resolution":{"observed_at":"2026-08-06T16:51:32.334006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-06T16:51:23.278023Z","title":"A survey on llm-as-a-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.278023Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:6f4bd81665aab1a30d156bfb1c96dc7056e6a0a139125765b1e3d15cca52f0d7","observation_id":"f5dd4f26-1fc6-476c-82ae-17cc33a5a2b1","resolution":{"observed_at":"2026-08-06T16:51:23.278023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:32.071866Z","title":"Regiongpt: Towards region understanding vision lan- guage model","venue":null,"work_id":"7c7abd7c-4d0a-438d-b690-132446358ef4","year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.322295Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:e77fb5a1b1bb35a1366c2c13b4952385110564520c195c5919bd623a9eef84f3","observation_id":"06b64956-6bb4-49af-9e10-b9e49bf46061","resolution":{"observed_at":"2026-08-06T16:51:32.189072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:31.880870Z","title":"Hires-llava: Restoring fragmen- tation input in high-resolution large vision-language models","venue":null,"work_id":"a79e02b2-a20f-4bac-9a70-8afc08aac5e6","year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.370201Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:47fb6cd89f753a31448d53fa416efffde6689fbc534d2e5e9370b279b7cf64e3","observation_id":"e8c18f00-3001-4fe4-886f-8417e463ac3e","resolution":{"observed_at":"2026-08-06T16:51:31.945422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:31.753064Z","title":"Seeing out of the box: End- to-end pre-training for vision-language representation learn- ing","venue":null,"work_id":"6c7ecd57-7ca6-404f-9a62-6cf81ee0c044","year":2021},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.432894Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:b836cd8438873fbe9bc458fa1e91b0a7aa63be3926346d6d1ba58347400d5e68","observation_id":"8449d0f0-9f88-4b7c-ba38-825c116fea0b","resolution":{"observed_at":"2026-08-06T16:51:31.820105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14783","last_updated":"2024-03-21T18:57:25Z","snapshot_observed_at":"2026-07-06T17:48:41.389936Z","submitted_at":"2024-03-21T18:57:25Z","title":"Multi-Agent VQA: Exploring Multi-Agent Foundation Models in Zero-Shot Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14783","snapshot_observed_at":"2026-08-06T16:51:23.503836Z","title":"Multi-agent vqa: Exploring multi-agent foundation models in zero-shot visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.503836Z"},"links":{"cited_paper":"/paper/2403.14783","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:7e2a3d41ca3314268a5742cb2bf1e8a3696b857bd328798fed2494be31b0bccb","observation_id":"2d1d844b-fbb9-4eba-9dd2-e89947ffb9d8","resolution":{"observed_at":"2026-08-06T16:51:23.503836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:31.669264Z","title":"Spa- tially aware multimodal transformers for textvqa","venue":null,"work_id":"f62d3674-366d-44e3-a5d1-792384a77147","year":null},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.575342Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:3be5d7c68dc692a1338c8be34b92626d8c5adc14e1416755920ab58e54991063","observation_id":"00a07c69-fb59-494f-a0bb-a36d5b4123d9","resolution":{"observed_at":"2026-08-06T16:51:31.696201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:31.460843Z","title":"Binary codes capable of cor- recting deletions, insertions, and reversals","venue":null,"work_id":"00d5923e-9853-41d9-8b7b-58e78c0aa4d3","year":1966},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.700616Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:9e5bf82aba81d90528756c6bf640b9355dd6fe47360c2599edf0cc75e72cb63b","observation_id":"a8f78605-3409-4d13-a3f9-d51b2fdcfc5f","resolution":{"observed_at":"2026-08-06T16:51:31.585020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:23.782830Z","title":"From gener- ation to judgment: Opportunities and challenges of llm-as-a- judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.782830Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:e832a9f88cb16ec11ba4e28eaebf3e8163285a8e254b53151c9fad0fe68e2358","observation_id":"92358a79-729d-47d1-aa8b-4cdc606fd0c0","resolution":{"observed_at":"2026-08-06T16:51:23.782830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T16:51:23.854998Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.854998Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:b95a88814cf9043a37dcb6db38976c533b86d3eb21796beabc0e9621c37ca56b","observation_id":"5ba75bd4-02e0-44dc-8bcf-3d33d8a96cdd","resolution":{"observed_at":"2026-08-06T16:51:23.854998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:23.950516Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.950516Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:d8445da225f3f3e48b7346bead2645783804d69231cf94794ceef8bb8044cdfb","observation_id":"95cb28d3-56cf-49dc-9ab2-76a98c31f153","resolution":{"observed_at":"2026-08-06T16:51:23.950516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:31.233227Z","title":"Blip-2: Bootstrapping language-image pre-training with 9 frozen image encoders and large language models","venue":null,"work_id":"8231c3fb-5d5c-4155-a9c4-d11a81b6dd44","year":2023},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:24.015831Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:17e3bcc2203511b8dae1750bfcbf25f9976c69ddf3c73570588327eb51e45f0f","observation_id":"1b0da12a-8b7c-41f3-8183-55f5ebaf44b9","resolution":{"observed_at":"2026-08-06T16:51:31.329965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-06T16:51:24.115929Z","title":"Visualbert: A simple and perfor- mant baseline for vision and language","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:24.115929Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:79c9e4dfbc98f5ee5a44c3753370d6c94092ee743d5fda13c38aca4580c0f83c","observation_id":"733fa32e-9fdf-4b49-aa95-9a54c59959ea","resolution":{"observed_at":"2026-08-06T16:51:24.115929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15409","last_updated":"2022-03-14T12:32:42Z","snapshot_observed_at":"2026-07-06T10:28:54.011729Z","submitted_at":"2020-12-31T02:46:47Z","title":"UNIMO: Towards Unified-Modal Understanding and Generation via Cross-Modal Contrastive Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15409","snapshot_observed_at":"2026-08-06T16:51:24.195805Z","title":"Unimo: Towards unified-modal understanding and generation via cross-modal contrastive learning","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:24.195805Z"},"links":{"cited_paper":"/paper/2012.15409","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:a38849f59091325810b7458abeb80eaf1635f40c13704d606f8031625e91c21e","observation_id":"e4b0003d-c9ef-4039-aaf3-b683aa25f547","resolution":{"observed_at":"2026-08-06T16:51:24.195805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:24.351412Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:24.351412Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:257807969a73e4db5249701c51723302f94bb45a22e4f7bec2a65a4c112cf4eb","observation_id":"7dedfffd-9ff3-42f3-95f0-e645bc29d63b","resolution":{"observed_at":"2026-08-06T16:51:24.351412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:31.036515Z","title":"Enhancing visual document understanding with contrastive learning in large visual-language models","venue":null,"work_id":"f4df9ac8-6d8d-4499-8a3b-06a6d86ce407","year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:24.429859Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:26b01e736770c3823acde8e017cda133633f6c1a2d198eae20a15b63d835e0c8","observation_id":"00944919-2683-4e18-9e2b-9d25779b7491","resolution":{"observed_at":"2026-08-06T16:51:31.125927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:30.847667Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"2dbf7c12-408e-4d67-a14a-d307b8de2e70","year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:24.520188Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:28134872741fb5476647f2ee5d680a9832c874746d85590624627b01754cd89a","observation_id":"786371db-77b2-4394-9012-dd66e803d6f6","resolution":{"observed_at":"2026-08-06T16:51:30.961752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16072","last_updated":"2025-04-22T17:51:41Z","snapshot_observed_at":"2026-07-06T21:13:09.093282Z","submitted_at":"2025-04-22T17:51:41Z","title":"Describe Anything: Detailed Localized Image and Video Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16072","snapshot_observed_at":"2026-08-06T16:51:24.655762Z","title":"Describe anything: Detailed localized image and video captioning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:24.655762Z"},"links":{"cited_paper":"/paper/2504.16072","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:ba0864e72feeb73970bfbfaa86a36453aaa34687f5e04893556679e1e4423d1b","observation_id":"c5e311f2-055f-4a36-8c66-36da3105ce8f","resolution":{"observed_at":"2026-08-06T16:51:24.655762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05302","last_updated":"2025-06-05T17:51:39Z","snapshot_observed_at":"2026-07-06T21:37:28.044836Z","submitted_at":"2025-06-05T17:51:39Z","title":"Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05302","snapshot_observed_at":"2026-08-06T16:51:24.717294Z","title":"Perceive anything: Recognize, explain, caption, and segment anything in images and videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:24.717294Z"},"links":{"cited_paper":"/paper/2506.05302","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:a477cb8d6f0f5f284057794e0ee7a243ddd3e4499eb0f7427f9dfdfe352e8aeb","observation_id":"1309521c-a60a-444f-ba0b-13861ed211f6","resolution":{"observed_at":"2026-08-06T16:51:24.717294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:30.701461Z","title":"Revive: regional visual representa- tion matters in knowledge-based visual question answering","venue":null,"work_id":"1fbcb288-a441-436f-b549-71d273b65222","year":null},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:24.785435Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:0f4355ca4c346e9276c60eceafb3c5825861c700b8cffcce0aca0cc8cb7ab54d","observation_id":"3b93f440-cb96-4770-bf11-64273b8b170f","resolution":{"observed_at":"2026-08-06T16:51:30.758577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-04T10:28:00.554323Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-06T16:51:25.051188Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:25.051188Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:30bdd9a31f9dd4925eab4ae2bc7dc81898a040e62329e73cc843224f04346eb8","observation_id":"b2244a65-2661-4e5a-9c3e-68e7cf52ac17","resolution":{"observed_at":"2026-08-06T16:51:25.051188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:25.447570Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:25.447570Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:75a281c3208d4df49723dc26d8ea17ef0d90e014c4314d2d484c150418758f3b","observation_id":"a6538a19-2053-4f7b-9b23-425ec16e278e","resolution":{"observed_at":"2026-08-06T16:51:25.447570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-06T10:47:13.078840Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-06T16:51:25.555322Z","title":"Ovis: Structural em- bedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:25.555322Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:954d67b1d46a978be44c9d9df4f9a7d13266e5aab54ddfbfcbfb9bdc21445717","observation_id":"f4713053-4307-437d-9fb0-c1d5bf82f1c1","resolution":{"observed_at":"2026-08-06T16:51:25.555322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:30.545094Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning","venue":null,"work_id":"b4510585-6129-4b6e-a61a-926abe99c44d","year":2022},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:25.609867Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:d574677ec4573290726ed4ce6b25f49310ec5264fa021ef916ef4b200aaf0d00","observation_id":"e20bd04a-b6ce-4e0a-b61c-6265f5921053","resolution":{"observed_at":"2026-08-06T16:51:30.597058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05506","last_updated":"2025-04-10T14:10:05Z","snapshot_observed_at":"2026-08-01T06:51:43.764895Z","submitted_at":"2025-04-07T21:05:06Z","title":"ChartQAPro: A More Diverse and Challenging Benchmark for Chart Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05506","snapshot_observed_at":"2026-08-06T16:51:25.669672Z","title":"Chartqapro: A more di- verse and challenging benchmark for chart question answer- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:25.669672Z"},"links":{"cited_paper":"/paper/2504.05506","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:834e52dbf7f506de6ecb8d61947ad21a4e703e7c43e4dcee20ffe6fbc8d523df","observation_id":"c027a98e-a9e1-4ea7-bf6c-cdc626865f15","resolution":{"observed_at":"2026-08-06T16:51:25.669672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:30.379257Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"85f07386-eccd-4d50-a5c7-3b2c4ff9d5a9","year":2021},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:25.772181Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:d844017d42244b06a1df539350773c0989b5e98fcd114127b0d0d4042b829bfa","observation_id":"0ed54717-4d24-459a-8862-33932e98ed8f","resolution":{"observed_at":"2026-08-06T16:51:30.453754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:30.275844Z","title":"Infographicvqa","venue":null,"work_id":"7ee543f8-56fd-421b-a0f3-cc01d43c5754","year":2022},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:25.886738Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:c7e4c7f95e9f480026673370eeec4f9cf6e73036b915ecc63e2a7d92576da4cc","observation_id":"ed5aed7a-4b02-4b57-b8d6-d165feae8ca5","resolution":{"observed_at":"2026-08-06T16:51:30.341084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:30.148561Z","title":"Im- proving automatic vqa evaluation using large language mod- els","venue":null,"work_id":"1e2b619c-1f85-44ff-b608-681146c67e8e","year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:26.023556Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:2e15188d8f5d7798b97818ad4ceb5277096e3d8969a2dda83e87dc6ff7da241e","observation_id":"4bd88eda-5aae-4f02-9111-162a601db482","resolution":{"observed_at":"2026-08-06T16:51:30.215862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:30.022263Z","title":"Dual dynamic consis- tency regularization for semi-supervised domain adaptation","venue":null,"work_id":"7fca3f20-1636-400a-a2d9-bf481f1e2b53","year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:26.157877Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:71cac51d0e01a2cae258d5fb03deb865cc18f413df5e98e35a7939a541bf498a","observation_id":"aec207f3-7fb0-490b-9c7d-b048f9e70ac8","resolution":{"observed_at":"2026-08-06T16:51:30.060757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03285","last_updated":"2025-03-06T12:42:37Z","snapshot_observed_at":"2026-07-06T20:47:04.984599Z","submitted_at":"2025-03-05T09:12:16Z","title":"Enhancing Vietnamese VQA through Curriculum Learning on Raw and Augmented Text Representations","version":2},"cited_work":{"arxiv_id":"2503.03285","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.03285","snapshot_observed_at":"2026-08-06T16:51:28.263804Z","title":"Enhancing Vietnamese VQA through Curriculum Learning on Raw and Augmented Text Representations","venue":"cs.CV","work_id":"4c05e77b-c3bd-42f2-aa5c-73704a016095","year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:26.251341Z"},"links":{"cited_paper":"/paper/2503.03285","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:39aa1411e029485cb23de2fe743e6e1e19b5aacf9db46bc341a30b70a10488b1","observation_id":"3f77f525-cd8e-49ef-8582-b112865b8d08","resolution":{"observed_at":"2026-08-06T16:51:28.310404Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T16:51:26.400816Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:26.400816Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:cfc1aaa84a3b6bb0ac9fc538d857926358d0ac61e6e95675e9cf0f34704414f1","observation_id":"9e63eb81-1d27-45f8-905b-48b84c43d7ab","resolution":{"observed_at":"2026-08-06T16:51:26.400816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:29.932222Z","title":"Going full-tilt boogie on document understanding with text-image-layout transformer","venue":null,"work_id":"d038d245-857f-47ec-a09c-fb50ffd2a3c3","year":2021},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:26.504317Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:c0967221fc4008fa1eab71c09da2994f2d75d59ae1acf9f1a3b152a28c51714f","observation_id":"e0d03647-33cc-4a4f-be42-c6cb0f661b42","resolution":{"observed_at":"2026-08-06T16:51:29.965392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:29.872483Z","title":"Towards vqa models that can read","venue":null,"work_id":"3965c325-4de0-4f5d-95b8-a0c5da125bf4","year":2019},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:26.642120Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:8cb4bb883a934025536b7d6b3180e7da32ecef94ba3813f23d822fce8652c83a","observation_id":"90daa82d-0ea6-4b00-af00-80fb5d86b8e1","resolution":{"observed_at":"2026-08-06T16:51:29.892501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:29.790258Z","title":"Gemini 2.5: Pushing the frontier with ad- vanced reasoning, multimodality, long context, and next gen- eration agentic capabilities","venue":null,"work_id":"7b9a319e-3fbd-4559-8853-89fafcd1327e","year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:26.791874Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:e236f6ac573659ec1af0f23030c93a401da60c4173df866e718fb49db8be5471","observation_id":"c66fd355-92af-4098-a040-fc45860ef684","resolution":{"observed_at":"2026-08-06T16:51:29.825409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:29.725156Z","title":"Igl-dt: Itera- tive global-local feature learning with dual-teacher semantic segmentation framework under limited annotation scheme","venue":null,"work_id":"bf80232d-859e-479b-8f72-331f295b59ba","year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:26.920416Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:7c32448055b09651f6cf162af1275f99968dc14edeb5cb849bf4df32b9d1abdb","observation_id":"d2fa1117-902e-4b5a-9b1f-80ce461457ff","resolution":{"observed_at":"2026-08-06T16:51:29.753418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:29.613272Z","title":"Mlg2net: Molecular global graph network for drug response prediction in lung cancer cell lines","venue":null,"work_id":"7721295c-6c7b-4842-8a3a-1f27e3f601ea","year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:27.048537Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:e0add82b05d9a35a4a8403df2e9ec73111e094e44a94b9b108917e98d2c924d6","observation_id":"245d17f9-558d-4cfc-b599-229a623e6672","resolution":{"observed_at":"2026-08-06T16:51:29.657037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05804","last_updated":"2025-05-25T20:00:44Z","snapshot_observed_at":"2026-08-03T17:20:09.243871Z","submitted_at":"2025-05-09T05:45:31Z","title":"Describe Anything in Medical Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05804","snapshot_observed_at":"2026-08-06T16:51:27.152580Z","title":"Describe anything in medical images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:27.152580Z"},"links":{"cited_paper":"/paper/2505.05804","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:d6371e71013a708d6d7f896b0b5494e8cd4ed41b3f91e0c55b6a34824b40fc5d","observation_id":"4897f6b0-da76-4f82-b5a6-5728fd922136","resolution":{"observed_at":"2026-08-06T16:51:27.152580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:29.516542Z","title":"Layoutlm: Pre-training of text and layout for document image understanding","venue":null,"work_id":"27d68cce-baf5-4b7f-93a7-79a4945d56c0","year":2020},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:27.234301Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:f3ae50e374f15bb26d4f24e7f7e433612d5bf356243aedf649fcf071985b067b","observation_id":"3c94e104-6be6-41c1-ac8e-556f2f15b7ee","resolution":{"observed_at":"2026-08-06T16:51:29.556329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:29.396742Z","title":"LayoutLMv2: Multi-modal pre-training for visually-rich document under- standing","venue":null,"work_id":"e695f9d6-3eef-418a-81d7-6645d8f16834","year":null},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:27.346184Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:56daeed6920cca56e5a1ab4565c6815d987e475a661157ac7e3066a6ab8aee58","observation_id":"eb9ae5ac-42fa-4da1-b241-8ea11a581587","resolution":{"observed_at":"2026-08-06T16:51:29.460892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T16:51:27.484932Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:27.484932Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:a303661c5f3f29f166d76b74e54da8a8bf59680809aa9e8790bcded932e1d5c5","observation_id":"b3db362a-53d8-482d-aefe-0a1772ec2630","resolution":{"observed_at":"2026-08-06T16:51:27.484932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T16:51:27.556990Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:27.556990Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:19f273bb7f2eef6ba37783a986200a154275ae2c5b2db3b591dd520c1af87d23","observation_id":"f42afdef-4402-4d9a-b516-53d06f90cedb","resolution":{"observed_at":"2026-08-06T16:51:27.556990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-06T16:51:27.621969Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:27.621969Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:b269d5cf34c7b8dcaeeea8412b3309b4c86f3c833e13479b37ff8b561038e43a","observation_id":"a5e660d4-88a1-4d62-b350-74de87d435b9","resolution":{"observed_at":"2026-08-06T16:51:27.621969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-06T13:03:19.727877Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-06T16:51:27.706414Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:27.706414Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:3ee3043934c7eae8564f16a59acfad0336bc84b0742e39e63122d0fe796a00c4","observation_id":"28d13954-ed74-4af8-affb-853296e5eb02","resolution":{"observed_at":"2026-08-06T16:51:27.706414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:29.259886Z","title":"Osprey: Pixel un- derstanding with visual instruction tuning","venue":null,"work_id":"dd71a94a-6fbe-44f9-abe0-a8b61e08801b","year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:27.807774Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:3ad2d808009a2aecf2d601412836ef4be6a5e59d226f678fdb58eb2162c4e0f2","observation_id":"62c9845f-ed78-4449-bf61-0f9f206f4657","resolution":{"observed_at":"2026-08-06T16:51:29.320554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T16:51:27.876456Z","title":"Videollama 3: Frontier multi- modal foundation models for image and video understand- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:27.876456Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:d2bc56e7116d0027d101bc96a2390aa50de26c1f2bb76e70003fbba332d6d67b","observation_id":"88b25ccb-9f43-4a5b-9165-a65529b3b75f","resolution":{"observed_at":"2026-08-06T16:51:27.876456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:29.097602Z","title":"Gpt4roi: Instruction tuning large language model on region- of-interest","venue":null,"work_id":"8fecc47d-568a-4078-a269-d92ed3b56acf","year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:27.936393Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:7960a0e769c00c3150d1f462cdc68240e5b7304dd71cb8c28550acf876dfeb30","observation_id":"b847188f-6b8a-41bd-b0be-40ba08d13d9e","resolution":{"observed_at":"2026-08-06T16:51:29.166465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:28.959768Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":"a5ffb2f1-32a2-4f82-b10e-095afb76eed5","year":2023},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:27.980688Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:ee6f2b1d3f27d6997e94370faf3efd39ef25efb1be50a59873902a10c8a58b23","observation_id":"c5f36874-abf2-4723-9ad4-0522f873d8d7","resolution":{"observed_at":"2026-08-06T16:51:29.029064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T16:51:28.030074Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:28.030074Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:69c39c70ecdddd46328fb55dfbc7ac97b22f4738afb0b807c3297171f5918a7e","observation_id":"b30d1ff6-ecec-48bc-abdf-5041da93373e","resolution":{"observed_at":"2026-08-06T16:51:28.030074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:27.417470Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:27.417470Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:f136e3616290cf8b604165628a7a2ced48ef66178238dda50e92dda84436b451","observation_id":"af5746fb-3597-4393-ac85-7f9f29d0aac8","resolution":{"observed_at":"2026-08-06T16:51:27.417470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:51:24.843669Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:24.843669Z"},"links":{"citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:890526d4eecd72daebc961f92205fe6436e6c7624fbedbd61a73fe38289d1d35","observation_id":"fec0588c-817c-4e8d-a524-d66f157feb45","resolution":{"observed_at":"2026-08-06T16:51:24.843669Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:43:19.836401Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":30,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2507.12441."}