{"as_of":"2026-08-11T13:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4abe455660ba75d017fb295f6403b343422c90c56c8835d274edf0b6d4c94629","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:38:24.547522Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.15144/citation-record","integrity":"/paper/2501.15144/integrity","json":"/paper/2501.15144/citation-record.json","paper":"/paper/2501.15144"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-10T14:38:24.015154Z","title":"Abdin, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.015154Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:b2d6d5f9623b6ad002a726d39a20109ec38f92e44a20105f108f07364ebe3beb","observation_id":"b9600f08-70cc-46cc-8d16-9e5bd6b977ae","resolution":{"observed_at":"2026-08-10T14:38:24.015154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.885655Z","title":"Alayrac, J","venue":null,"work_id":"ab8ba3bc-a27e-4a72-a15a-c524374216c4","year":2022},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.020398Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:c18c5b1760e05cc8daf83181461a7185da6ce807e6f1216b2a04eb2e6dc80912","observation_id":"0a930986-248c-450f-9d8e-60d6af521c45","resolution":{"observed_at":"2026-08-10T14:38:25.890814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T14:38:24.025536Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.025536Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:c3b7fe3d9f0e50890c850b26d6beefa45653e31b7a5e4ea777ea6c7a01867e71","observation_id":"fe7bcbf2-fa40-4db2-a84a-a1d8bbfed217","resolution":{"observed_at":"2026-08-10T14:38:24.025536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-10T14:38:24.045964Z","title":"Beyer, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.045964Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:c4d3de3b4f85411dc4d6285b865df0026f6d9cf9380dd32c77caaa5a1b92026e","observation_id":"940a74c5-8ba4-48df-a740-0a32275092f2","resolution":{"observed_at":"2026-08-10T14:38:24.045964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.871570Z","title":"Carion, F","venue":null,"work_id":"c4cb2688-a70a-45d0-97a7-13fbfa64636a","year":2020},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.156760Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:bc8972061f8836e8a2b208eb19077d4aaeec47d6b1d690dae068bad0a3710e23","observation_id":"10576d6b-f8c2-49ee-b744-fed08389c296","resolution":{"observed_at":"2026-08-10T14:38:25.875882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.729069Z","title":null,"venue":null,"work_id":"7af5360a-d84b-4a79-bcaf-9587125baf83","year":2016},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.193224Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:981859f081cc6c671a60b867abf470862632dc914045bc75f62ca05999ed0430","observation_id":"3c1a8817-28ba-4336-8eb7-c38a2dcd6382","resolution":{"observed_at":"2026-08-10T14:38:25.861327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T14:38:24.199332Z","title":"Dubey, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.199332Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:105e32ec1bc3f14a96a84bbab61c5ae745c498a410f321b81a25ad7436a56343","observation_id":"4dceec40-7eab-41d6-9659-523db1b678d9","resolution":{"observed_at":"2026-08-10T14:38:24.199332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.648847Z","title":null,"venue":null,"work_id":"8d6f6f88-0932-4764-abd8-d79783cd6f17","year":null},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.204219Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:3e0f951a13c629a15dbc3ac3b6dc1821e70e7e772141bf1087724e5d45b6f463","observation_id":"238f5e4a-4b42-4556-a9d0-95e355648d00","resolution":{"observed_at":"2026-08-10T14:38:25.654140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.633683Z","title":null,"venue":null,"work_id":"eab60c12-11ce-4ef2-aea3-96ba0cf3fcfd","year":2001},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.209906Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:818c1c94753faa76fa47fdc236973cbff191267c562f60ec1cb4e9795f9b1b2e","observation_id":"6b657000-0ba8-412d-aa29-55ab72f5b5b0","resolution":{"observed_at":"2026-08-10T14:38:25.639103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.619668Z","title":"Kv and A","venue":null,"work_id":"9fb0d110-b6df-468a-9219-17415b356aa8","year":2020},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.214634Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:371172063a1d2296a2e3de63c5cbe045959fbc0c5491160fcd98486cc3445c6f","observation_id":"bec82237-c7d1-4272-81e2-49e398be6a08","resolution":{"observed_at":"2026-08-10T14:38:25.623751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.525678Z","title":null,"venue":null,"work_id":"f41cee42-0857-401d-a7b0-7ad55d885345","year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.219493Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:de7fc8a92c5791bd8ba8043ce5c0c0dfcfe634df462f25c3b310bb17dda5e3d1","observation_id":"0977a93c-da7a-4db5-8d65-abb39d5a0576","resolution":{"observed_at":"2026-08-10T14:38:25.609875Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.399659Z","title":"Minervini, A","venue":null,"work_id":"2e6fdc9a-2c39-4f9d-9803-4f0a0f7da039","year":2016},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.223550Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:cb1afb5364c2863aac8bdf6766bf6c9f97d517a32d3e37e486fff3de73678d5d","observation_id":"5d547e25-110d-46d1-9a00-7089337b122f","resolution":{"observed_at":"2026-08-10T14:38:25.420462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14544","last_updated":"2024-06-20T17:54:03Z","snapshot_observed_at":"2026-08-01T02:50:15.518197Z","submitted_at":"2024-06-20T17:54:03Z","title":"Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs","version":1},"cited_work":{"arxiv_id":"2406.14544","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14544","snapshot_observed_at":"2026-08-10T14:38:24.730733Z","title":"Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs","venue":"cs.CV","work_id":"bf926c71-6044-4d03-aee7-209bf6897cb3","year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.228150Z"},"links":{"cited_paper":"/paper/2406.14544","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:933cae0f8efba7f2443e085530fdebdb7010d1dcc8512d567006ddc70df4491f","observation_id":"b1114157-1104-4bb7-a156-a3ff464717d8","resolution":{"observed_at":"2026-08-10T14:38:24.771826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.384834Z","title":"Radford, J","venue":null,"work_id":"d903ba79-9b1d-4cae-b459-d0692ecfe607","year":2019},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.233127Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:20673007ef5ca89ace48f5d5636d59558e229d7a4d96e561dcc0f5cf11f28336","observation_id":"d6e0c9c3-502f-4b1d-8630-292561fcc54d","resolution":{"observed_at":"2026-08-10T14:38:25.389601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T19:28:02.997514Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-10T14:38:24.238672Z","title":"Rahmanzadehgervi, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.238672Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:c724265e147a10ef5da93bfd83af69d70801ef8c880c6be5fd979c9f4c72411b","observation_id":"4492f9b0-c03f-4c34-9738-dd928133df44","resolution":{"observed_at":"2026-08-10T14:38:24.238672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.369857Z","title":null,"venue":null,"work_id":"d38d2850-b95c-43e2-bf69-1c0b68dcba4b","year":null},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.293516Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:50ad219a9cab45605ed0ad6fa3d1d25a7f796963ff646a2c8f3dd229030c68cb","observation_id":"235333c6-971a-48ab-9389-ae5ccdd6eb78","resolution":{"observed_at":"2026-08-10T14:38:25.374655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.276350Z","title":"Salewski, A","venue":null,"work_id":"0c29eb07-6707-49b2-98fe-8357ff2659d8","year":2020},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.411039Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:f8a0f3ef5c71a0f1b50c0c0751bca0b9f7a7462bba4515f1376a10fbc70867ff","observation_id":"c63b0f55-e4ae-4d82-a09a-99c4ce743a26","resolution":{"observed_at":"2026-08-10T14:38:25.358212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.133020Z","title":null,"venue":null,"work_id":"c6767aa0-ac97-4378-96d2-cb192be78a6c","year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.481439Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:9fc3d6b9c654e86a7f8ec73b02c4fceebf0b560ce8c44f4a7f975ceff4739c9f","observation_id":"96a05e5f-1e9b-4574-be11-c733b22f262a","resolution":{"observed_at":"2026-08-10T14:38:25.176242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19237","last_updated":"2024-06-28T05:43:46Z","snapshot_observed_at":"2026-08-05T06:50:43.970218Z","submitted_at":"2024-06-27T15:01:48Z","title":"FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19237","snapshot_observed_at":"2026-08-10T14:38:24.505902Z","title":"Singh, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.505902Z"},"links":{"cited_paper":"/paper/2406.19237","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:77d0cd70015a6d94d6255419c3fe6813429c34adecbe12494de877c82055c11f","observation_id":"6eef9f09-924d-460d-8b05-be5df45f10d9","resolution":{"observed_at":"2026-08-10T14:38:24.505902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09269","last_updated":"2024-12-12T06:26:09Z","snapshot_observed_at":"2026-08-11T06:18:17.926324Z","submitted_at":"2024-09-14T02:29:36Z","title":"Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09269","snapshot_observed_at":"2026-08-10T14:38:24.510393Z","title":"Sinha, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.510393Z"},"links":{"cited_paper":"/paper/2409.09269","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:811e3830dc0df12344e6d9d8898c9f71edbca42c35f3dc01413b116962351bb7","observation_id":"e1cdf967-880c-4933-8791-c87a16da6ac7","resolution":{"observed_at":"2026-08-10T14:38:24.510393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T14:38:24.514755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.514755Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:da30a90384c6634e029e6d27a3aad41b87e8e76f3efa0d16f372b2afe3c76f39","observation_id":"d08b5476-9cec-49ff-883a-52c4d94ca8a0","resolution":{"observed_at":"2026-08-10T14:38:24.514755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T14:38:24.519030Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.519030Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:9a9ddaab6a30378f35696049555c494ce2a187654af935f8ed1cfc8d33140127","observation_id":"0cb8647d-f12e-44d0-bd35-61754c089210","resolution":{"observed_at":"2026-08-10T14:38:24.519030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T14:38:24.523145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.523145Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:f9f5b17e918b95b12e63d39f68c8108588a583745ba9b026703348eb0ac192fb","observation_id":"a700a717-608f-4fbb-b18d-4bd2b1c7d44b","resolution":{"observed_at":"2026-08-10T14:38:24.523145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.117451Z","title":"Specifically, the shape limit is increased to 5–6 shapes per image, and the occlusion limit is also raised to 5–6 shapes","venue":null,"work_id":"cfb17dba-28b7-4b12-94ec-57ba31f52f22","year":null},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.528507Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:ec22f1cfbe973a5d5739602e6efc7f960ab2a46acf8fa3708ac2b42ac08854d0","observation_id":"9eea5803-ea97-434c-ace7-79e3569581ad","resolution":{"observed_at":"2026-08-10T14:38:25.121899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.102242Z","title":"This setup tests the model’s ability to detect and attribute more shapes in configurations that were not present in the training data","venue":null,"work_id":"38e30962-5274-456a-a3a3-0ec70adf8630","year":null},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.533223Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:91801efedee99690417f224ba836641fc1712d46772c8bbab1565ee1a65ddff2","observation_id":"06aa8683-e30e-4912-a802-ed735ad8f655","resolution":{"observed_at":"2026-08-10T14:38:25.106796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:24.966921Z","title":"This scenario assesses the model’s ability to accurately detect and attribute shapes under previously unseen levels of occlusion","venue":null,"work_id":"a1e21861-9a56-4af5-b110-17ec1e5d04fe","year":null},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.538152Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:d4dfca67d9302c5e548c9de7cd9b34bcd31343777a42f53c3666c2459033e536","observation_id":"628f8bf5-7b8d-4947-b61f-b63869b57ebf","resolution":{"observed_at":"2026-08-10T14:38:25.038081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:24.874858Z","title":"The ability to generalize to these out-of-domain rotations Model OD Comp","venue":null,"work_id":"7ad2203a-6467-4431-b556-9151ce0e8043","year":null},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.543002Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:338fea5e9c39183caff75872568d806c5d0d4710737dfc3ff12e9a4d0e99839f","observation_id":"c0a8e2e7-c228-495c-b296-9ff3fdc85bc8","resolution":{"observed_at":"2026-08-10T14:38:24.879894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:24.859668Z","title":"Sentence Format Tuple Format MiniCPM-V2.5 Figure S4. Sentence Vs Tuple Output Comparison for MiniCPM-V2.5 Models for Validation Dataset","venue":null,"work_id":"01d53ea0-2619-471d-928d-2b8e4aef062e","year":2000},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.547522Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:51daf8bd40d30483570b4c0e1bf08cf5217a0c2f80bafc48221e26d9f38b5626","observation_id":"1387a2fc-f641-4791-98f9-ac2311053ecc","resolution":{"observed_at":"2026-08-10T14:38:24.864409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T14:32:27.866635Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2501.15144."}