{"as_of":"2026-08-08T20:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd12868fff8e29096d6b26d2d8441a37f72f85dd2121029dde18340485060288","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:07:20.058994Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19944/citation-record","integrity":"/paper/2505.19944/integrity","json":"/paper/2505.19944/citation-record.json","paper":"/paper/2505.19944"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-07-06T05:13:30.860932Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-07T14:07:17.749975Z","title":"Understanding inter- mediate layers using linear classifier probes.arXiv preprint arXiv:1610.01644, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:17.749975Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:9f37a419222b5aef366fdb9128ebf11cd8de826f27cf91390a2543c324d4ace4","observation_id":"39471ad9-2149-4212-ab77-4c84f03b3515","resolution":{"observed_at":"2026-08-07T14:07:17.749975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T14:07:17.838017Z","title":"OpenFlamingo: An open-source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:17.838017Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:b976cb19dc8bb8a1b94c7c9930c4f9578890bbb67754f77690294573c865dff3","observation_id":"15425ba8-7583-45ec-bcb5-af119347e278","resolution":{"observed_at":"2026-08-07T14:07:17.838017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:23.421389Z","title":"Neural codes for image retrieval","venue":null,"work_id":"b3e50025-4cff-4520-8e6f-51be992ea40c","year":2014},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:17.881086Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:5aa24aa075c46eefbb2ffda7d55188c11b281f27d77f2f0c709085fa6ce2db45","observation_id":"6840dfbf-15ea-4ce4-b255-7e5c5f94f55d","resolution":{"observed_at":"2026-08-07T14:07:23.472836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14517","last_updated":"2022-01-11T03:50:31Z","snapshot_observed_at":"2026-07-06T11:14:04.454155Z","submitted_at":"2021-05-30T12:34:17Z","title":"GeoQA: A Geometric Question Answering Benchmark Towards Multimodal Numerical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14517","snapshot_observed_at":"2026-08-07T14:07:17.952748Z","title":"GeoQA: A geomet- ric question answering benchmark towards multimodal nu- merical reasoning.arXiv preprint arXiv:2105.14517, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:17.952748Z"},"links":{"cited_paper":"/paper/2105.14517","citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:ce5080d0fb221458cfd266027b7071d5e4a25bef463bd806426f26d73f83c743","observation_id":"3c66b4bf-0e7e-434e-b2d1-9df26c205382","resolution":{"observed_at":"2026-08-07T14:07:17.952748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:23.248445Z","title":"Are we on the right way for evaluating large vision-language models? InAdv","venue":null,"work_id":"91b1598c-39ff-401e-96ea-446b31a0c17e","year":2024},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:18.029280Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:bcd2a0efbfaccd7222b44c34b087d51396d0d26ef181ba91f9e5cc92dc99acfb","observation_id":"a519e5e2-26d5-4070-a650-1918f41a2bd2","resolution":{"observed_at":"2026-08-07T14:07:23.314526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-07T14:07:18.135269Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:18.135269Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:0850f16a6c69e796517a9db9bbd2582d9d813d25b0f9691aaa5b64ff6f607a16","observation_id":"01660096-ceee-4595-967a-1b7a508dab39","resolution":{"observed_at":"2026-08-07T14:07:18.135269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:23.072030Z","title":"What you can cram into a single $&!#* vector: Probing sentence embeddings for lin- guistic properties","venue":null,"work_id":"46d445d5-7163-4220-8b3f-e2ab67dcbbd9","year":2018},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:18.206189Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:dc2a69c16bb67f6b180c9bb0180beb801b9e8371a6b6f1c876c0ef4e71eba8b4","observation_id":"cbf9bf9f-8a64-4cde-8b7d-f57ec038c2ad","resolution":{"observed_at":"2026-08-07T14:07:23.141131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:22.920388Z","title":null,"venue":null,"work_id":"7c5a8374-5ae0-4aad-80e5-b18a2e70c907","year":1991},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:18.275398Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:6240a8af4cc99ce83414a31edfdc0afd04040856bf74d9ca9b0a2ca76d908fe7","observation_id":"c5f4f1d8-5e21-41dd-bd76-3b8db9d45745","resolution":{"observed_at":"2026-08-07T14:07:22.993229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:22.797177Z","title":null,"venue":null,"work_id":"62f21986-4844-46cb-a9d9-9e57878afebf","year":2022},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:18.339017Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:b8163a6a2de71613d7c625b3292667d78921ae3eda388fecba1b6f734b80be67","observation_id":"feca93f9-d9bf-46aa-bb58-2b31043ea144","resolution":{"observed_at":"2026-08-07T14:07:22.873637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T14:07:18.386462Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:18.386462Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:501b9097233e3df73842bc2e8ac9a4eedc49d47bd13cdc28cb411208113850a3","observation_id":"10cd801b-d7d7-47e9-a18c-c49f6d9f1bd6","resolution":{"observed_at":"2026-08-07T14:07:18.386462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T14:07:18.468295Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:18.468295Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:a4a9317f96f36e16486b2bf11ebf3b60e9744aec08c0c9934927f28d714a6288","observation_id":"9256d60c-dabc-4af2-b317-1c2f7b9f2ee2","resolution":{"observed_at":"2026-08-07T14:07:18.468295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:22.640840Z","title":"LLaV A-NeXT: Im- proved reasoning, OCR, and world knowledge.https: / / llava - vl","venue":null,"work_id":"cd4f38ca-57fd-4f2b-96f1-55cb5ac78fff","year":2024},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:18.580748Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:d5cf8edb1118add3c8a7b65bb9f457a27779b1b7038ee236d293516f0dfa509c","observation_id":"e21d1d39-45dd-4cbe-9757-dd4859b1091e","resolution":{"observed_at":"2026-08-07T14:07:22.708865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:22.470864Z","title":"MathVista: Evaluating mathemat- ical reasoning of foundation models in visual contexts","venue":null,"work_id":"3f740f1a-ae80-4929-9cb1-8bfd1138843e","year":2024},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:18.662136Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:49c4036387e7cdfa9a53e6d57941e6d523f622e9d92ef3182252306a90c91588","observation_id":"3d4b7091-b4eb-404e-a5c5-cf13591b1663","resolution":{"observed_at":"2026-08-07T14:07:22.554493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:22.305901Z","title":"CLIP ViT-B/32.https://huggingface.co/ openai/clip-vit-base-patch32, 2021","venue":null,"work_id":"2cd97fa2-2f6d-4814-be60-15851285ffca","year":2021},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:18.768103Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:77f2ba10431dabdfb8c5942b4a983399fa318ff580dd4c772a765afa0efb080c","observation_id":"0ee13ad4-fb7e-4074-bc2f-54c22c545f54","resolution":{"observed_at":"2026-08-07T14:07:22.368834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:22.104235Z","title":"CLIP ViT-L/14-336.https://huggingface","venue":null,"work_id":"872a2ada-99b4-492e-8a5b-e04716b940c6","year":null},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:18.860984Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:9975624eb6c30e60278a112c2e164031c34cbb982b779d70c7f3255747394955","observation_id":"ef4f94de-b285-4dcf-b4fb-68e9e6189ad8","resolution":{"observed_at":"2026-08-07T14:07:22.193856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:07:19.043623Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:19.043623Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:e5c79722af7b3859fed81ab5ee05294062ff271ddc819c3412de86539fa8e7b2","observation_id":"f2afb6e4-0f69-402e-803c-94fd551c98a8","resolution":{"observed_at":"2026-08-07T14:07:19.043623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:21.782672Z","title":"Hello, GPT-4o, 2023","venue":null,"work_id":"9c4f1d62-611c-4bc1-8e1f-d1af0e492d0c","year":2023},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:19.114429Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:b54590e29f16b1eb0ae65c03c288231385333bbc551ae235c4b80181bed4ad66","observation_id":"021ebe13-dda6-4a68-9d94-6be23c62d492","resolution":{"observed_at":"2026-08-07T14:07:21.849237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:19.211866Z","title":"Language models are unsu- pervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:19.211866Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:7a7a14c84b505a28a710f77eef46ac94fb6c131b996feadb9ca97f45dba0bd72","observation_id":"4a48a3ef-7915-4365-80ee-d887729d4ad4","resolution":{"observed_at":"2026-08-07T14:07:19.211866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:19.321307Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:19.321307Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:df400bc39c557274ff98aa07bf6d94b17c8d845b961a450828db984d78f18a49","observation_id":"bae674e7-28f6-4f70-9d20-ea7ac8cf3d74","resolution":{"observed_at":"2026-08-07T14:07:19.321307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:21.562553Z","title":"Vision language models are blind","venue":null,"work_id":"88317fb2-f57d-43e0-966d-6bdb9ac20149","year":2024},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:19.426053Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:c10a9387610733be21c9845d7a1329f3b2849fad95c454fb650554dd43c874c9","observation_id":"583e82d8-3d67-4a2a-b75b-3dc7d83a6f03","resolution":{"observed_at":"2026-08-07T14:07:21.645904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:21.341848Z","title":"CNN features off-the-shelf: an astound- ing baseline for recognition","venue":null,"work_id":"c38963c8-a94b-4f15-ba82-274003a70044","year":2014},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:19.484458Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:8326518486a136838f60c3156edc6dad33f2887ddb7be4a0e3c8925a78112be5","observation_id":"269978b4-6d20-4519-b803-4644348d04fa","resolution":{"observed_at":"2026-08-07T14:07:21.450556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:21.188009Z","title":"FlowVQA: Mapping multimodal logic in visual question an- swering with flowcharts","venue":null,"work_id":"b8931a1d-7942-432e-9aff-57bc518e4752","year":2024},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:19.576412Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:1173c55906da9c661e3fff4de08b858cf94c0bafefb6e7fccfe387c01fce2e65","observation_id":"122c9e54-676f-46a2-b903-7e38d0211383","resolution":{"observed_at":"2026-08-07T14:07:21.259613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T14:07:19.645208Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:19.645208Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:a9251dae517149c6b0db0532a1b061eb338cb0e0eb09a95ca4c723d4cc09470a","observation_id":"6b44838c-7224-42f5-87f6-6b742d9b635c","resolution":{"observed_at":"2026-08-07T14:07:19.645208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:20.990180Z","title":"How well do vision models encode diagram attributes? Inthe ACL 2024 Student Research Workshop, 2024","venue":null,"work_id":"d9a89b5e-82c1-4592-94a4-47a62e1f180b","year":2024},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:19.770636Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:e56c54fd0cbf42c75befc3320f17a6073851c7dc42cc17a7a4117ebb1aa46464","observation_id":"da8f3efc-55c7-4383-8605-3a9269e26372","resolution":{"observed_at":"2026-08-07T14:07:21.086930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:20.722714Z","title":"MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert AGI","venue":null,"work_id":"26c1a160-26d0-4306-ab61-dde0355bb8d9","year":2024},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:19.873890Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:e3dd5df38b183b3d38603d68ce92c1efa074567838eb27d5af0bd216d89e4f94","observation_id":"4d5510b3-200f-4346-8ad0-b15a579ca76b","resolution":{"observed_at":"2026-08-07T14:07:20.800916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:20.520218Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":"d3a88d10-ad64-4649-8eba-cdac58cb4147","year":2024},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:19.966361Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:e609f3f887c68553996ddc2e2eeedb42e806fcb2e78473972ac8ade1e885b10b","observation_id":"53cb6495-33d5-4ab9-892d-a7e523cbd428","resolution":{"observed_at":"2026-08-07T14:07:20.608602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T14:07:20.058994Z","title":"MiniGPT-4: Enhancing vision- language understanding with advanced large language mod- els.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:20.058994Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:d8e7ea438ccf2a9fbe3132fdbdb61023af0a05caed19b54088ce96abe6900976","observation_id":"96ce0fac-082c-43f0-8b31-9f7c8e30d11e","resolution":{"observed_at":"2026-08-07T14:07:20.058994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:21.951373Z","title":"Accessed: 2025-04-12","venue":null,"work_id":"d860a2f2-6aca-4f7f-9bd5-638430f8e2f0","year":2025},"citing_paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:18.935665Z"},"links":{"citing_paper":"/paper/2505.19944"},"observation_digest":"sha256:6d875c56d7b47c1fdc75f30b7289a9ed9cc63952caccefd6250a584f0e87903f","observation_id":"c3a0f9ef-7804-437b-8a68-3ca0b5960f85","resolution":{"observed_at":"2026-08-07T14:07:22.028089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19944","last_updated":"2025-05-26T13:09:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:00:47.519860Z","submitted_at":"2025-05-26T13:09:31Z","title":"Can Visual Encoder Learn to See Arrows?"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2505.19944."}