{"as_of":"2026-08-23T14:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8999e45aafdf054bb6d777e139dab11701802975b67fac8a9bcef7e3a1d07949","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:52:36.195441Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T13:49:17.343893Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"cited_work":{"arxiv_id":"2508.20279","doi":"10.48550/arxiv.2508.20279","metadata_source":"pith","pith_arxiv_id":"2508.20279","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","venue":"cs.CV","work_id":"0a383ac2-0bc5-496f-a17d-db89bd20a194","year":2025},"citing_paper":{"arxiv_id":"2604.17941","last_updated":"2026-04-20T08:21:06Z","snapshot_observed_at":"2026-08-15T01:23:26.411341Z","submitted_at":"2026-04-20T08:21:06Z","title":"From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-05-10T05:44:37.891638Z"},"links":{"cited_paper":"/paper/2508.20279","citing_paper":"/paper/2604.17941"},"observation_digest":"sha256:114bc958bd88e848c736a933be5e8a930a3b0e2eaeea37f11baa12d9dbc990a7","observation_id":"325c9e4d-786b-4d8f-8499-f721c7ce50e8","resolution":{"observed_at":"2026-05-10T05:46:09.429677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"cited_work":{"arxiv_id":"2508.20279","doi":"10.48550/arxiv.2508.20279","metadata_source":"pith","pith_arxiv_id":"2508.20279","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","venue":"cs.CV","work_id":"0a383ac2-0bc5-496f-a17d-db89bd20a194","year":2025},"citing_paper":{"arxiv_id":"2606.20077","last_updated":"2026-08-13T16:20:55Z","snapshot_observed_at":"2026-08-16T23:12:09.626355Z","submitted_at":"2026-06-18T10:52:49Z","title":"The Hidden Evolution of Disguised Visual Context inside the VLM","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-26T18:08:56.044278Z"},"links":{"cited_paper":"/paper/2508.20279","citing_paper":"/paper/2606.20077"},"observation_digest":"sha256:75c904d602833ce125eb1f83a27fcd30020f34ac29aae06e4323524e0dda6f1a","observation_id":"6dbcd8c3-ad05-4cb3-9a1b-e44e89f2ed65","resolution":{"observed_at":"2026-07-04T03:19:31.847233Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"cited_work":{"arxiv_id":"2508.20279","doi":"10.48550/arxiv.2508.20279","metadata_source":"pith","pith_arxiv_id":"2508.20279","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","venue":"cs.CV","work_id":"0a383ac2-0bc5-496f-a17d-db89bd20a194","year":2025},"citing_paper":{"arxiv_id":"2607.08009","last_updated":"2026-07-09T00:27:07Z","snapshot_observed_at":"2026-08-13T06:08:17.610900Z","submitted_at":"2026-07-09T00:27:07Z","title":"From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs","version":1},"reference_index":198,"source":"arxiv_source","source_observed_at":"2026-07-10T13:49:17.343893Z"},"links":{"cited_paper":"/paper/2508.20279","citing_paper":"/paper/2607.08009"},"observation_digest":"sha256:41b94b31d89c2350257fa28842731b0c9ea4579e83dfc272398c63874916b0bf","observation_id":"c976d48f-b72b-45db-a734-c8aebcdc54a5","resolution":{"observed_at":"2026-07-10T13:57:06.697512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20279/citation-record","integrity":"/paper/2508.20279/integrity","json":"/paper/2508.20279/citation-record.json","paper":"/paper/2508.20279"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:52:36.475521Z","title":"Wenliang Dai, Junnan Li, Dongxu Li, Anthony Tiong, Junqi Zhao, Weisheng Wang, Boyang Li, Pascale N Fung, and Steven Hoi","venue":null,"work_id":"b056e1ac-7ef5-4821-b11c-7eca92fa693f","year":2023},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.120038Z"},"links":{"citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:e3b46be99f44c7f7db5c8db443ca979f3ef14418e7750b1ab206b06503769181","observation_id":"98858cfd-a862-4147-82de-a1a33a542fb1","resolution":{"observed_at":"2026-08-15T16:52:36.480094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T16:52:36.124101Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.124101Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:e8d10d984df1b899a31b002380f4fc1b6b028b91cb96d6ee47e14cd8730da665","observation_id":"806ad925-4db3-45d3-8eaa-704092268396","resolution":{"observed_at":"2026-08-15T16:52:36.124101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11944","last_updated":"2024-11-06T22:37:30Z","snapshot_observed_at":"2026-08-16T13:42:08.334213Z","submitted_at":"2024-06-17T17:49:00Z","title":"Transcoders Find Interpretable LLM Feature Circuits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11944","snapshot_observed_at":"2026-08-15T16:52:36.127974Z","title":"Transcoders find interpretable llm feature circuits","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.127974Z"},"links":{"cited_paper":"/paper/2406.11944","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:5fa5a6dee4c644578ce1472e17bb0aaf86389a412697d05bead30009f09c8161","observation_id":"7dfd39f7-2da9-4227-b077-c9105219996a","resolution":{"observed_at":"2026-08-15T16:52:36.127974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-15T16:52:36.132100Z","title":"Scaling and evaluating sparse autoencoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.132100Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:1a35e020354ba2a5f6f9d40ee05aa0f3a9c27e80cd26be6991113762df2e1edc","observation_id":"e033c343-9192-40e3-ad5e-00400c0a5741","resolution":{"observed_at":"2026-08-15T16:52:36.132100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16320","last_updated":"2025-02-07T20:56:08Z","snapshot_observed_at":"2026-08-21T10:58:43.296453Z","submitted_at":"2024-06-24T05:13:19Z","title":"What Do VLMs NOTICE? A Mechanistic Interpretability Pipeline for Gaussian-Noise-free Text-Image Corruption and Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16320","snapshot_observed_at":"2026-08-15T16:52:36.136411Z","title":"What do vlms notice? a mechanistic interpretability pipeline for gaussian-noise- free text-image corruption and evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.136411Z"},"links":{"cited_paper":"/paper/2406.16320","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:cbf72be02ecadaefeb83e6616ec3da839425d2582b9a518724d7761c90b89a18","observation_id":"b2656b8f-2356-46a8-8b2d-f17385bd7e63","resolution":{"observed_at":"2026-08-15T16:52:36.136411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15255","last_updated":"2024-04-23T17:42:29Z","snapshot_observed_at":"2026-08-12T21:46:28.191953Z","submitted_at":"2024-04-23T17:42:29Z","title":"How to use and interpret activation patching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15255","snapshot_observed_at":"2026-08-15T16:52:36.144344Z","title":"How to use and interpret activation patching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.144344Z"},"links":{"cited_paper":"/paper/2404.15255","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:f69e2771e745ebe9788011af1dd41cd24baa055727a1a781d7e0bc9103737bd9","observation_id":"2f1d0792-cf1a-4ede-bc7a-fb26795b264d","resolution":{"observed_at":"2026-08-15T16:52:36.144344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11193","last_updated":"2024-10-01T17:04:22Z","snapshot_observed_at":"2026-08-20T02:40:25.224185Z","submitted_at":"2024-06-17T03:59:44Z","title":"MMNeuron: Discovering Neuron-Level Domain-Specific Interpretation in Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11193","snapshot_observed_at":"2026-08-15T16:52:36.152984Z","title":"Mmneuron: Discovering neuron-level domain-specific interpretation in multimodal large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.152984Z"},"links":{"cited_paper":"/paper/2406.11193","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:fa7d1dde363b9064d4feb5273ec1b59d432ddd348e7d70ee86264980fdc3cfb9","observation_id":"aa626305-c01b-4707-b1a9-4c551602a5c9","resolution":{"observed_at":"2026-08-15T16:52:36.152984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06981","last_updated":"2025-05-21T00:01:46Z","snapshot_observed_at":"2026-08-21T23:41:53.268536Z","submitted_at":"2024-10-09T15:18:57Z","title":"Quantifying Feature Space Universality Across Large Language Models via Sparse Autoencoders","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06981","snapshot_observed_at":"2026-08-15T16:52:36.157175Z","title":"Sparse autoencoders reveal universal feature spaces across large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.157175Z"},"links":{"cited_paper":"/paper/2410.06981","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:16361eac66fe7cbf8fe9e536a993abfa4555e156c8e04609cdbbaa7632e6398b","observation_id":"315330f3-a536-4e49-b825-6dab7b2bf359","resolution":{"observed_at":"2026-08-15T16:52:36.157175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:52:36.448324Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024a","venue":null,"work_id":"8ace4d01-7a91-414c-9135-b23733f85010","year":2024},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.162890Z"},"links":{"citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:06137f2e8ccd470db7e3af9ba7f6b272b44162a1fe8cd303e232e77ff09dcd5f","observation_id":"de0f6f12-f9dd-4b7b-ad90-f5d2b918a6d3","resolution":{"observed_at":"2026-08-15T16:52:36.453104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-20T02:39:35.450758Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-15T16:52:36.166625Z","title":"Ac- cessed: 2025-03-26","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.166625Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:007fa61f338eeaeeb3e7932ca64cc634be15c185d504415cacaa56cf2d1da552","observation_id":"d7f5f1c2-47ec-4ea0-acd2-ece3ba25cc58","resolution":{"observed_at":"2026-08-15T16:52:36.166625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T16:52:36.171048Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.171048Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:ea286152afea5a17d418d4e339603aef282668acfab20ac9f106ec29578a34c6","observation_id":"21e32dec-0b15-41cc-b523-251b9567f762","resolution":{"observed_at":"2026-08-15T16:52:36.171048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T16:52:36.174971Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.174971Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:0d7ec8e61cc9b81d97c04399599b1cd073f46ad67388d6a96fccaa52e1d4bb64","observation_id":"8bf32ff1-16ac-4f5e-80d4-9b39ba6113a3","resolution":{"observed_at":"2026-08-15T16:52:36.174971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05216","last_updated":"2024-04-13T15:22:39Z","snapshot_observed_at":"2026-08-20T02:38:04.071250Z","submitted_at":"2023-10-08T16:16:21Z","title":"Probing Large Language Models from A Human Behavioral Perspective","version":2},"cited_work":{"arxiv_id":"2310.05216","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.05216","snapshot_observed_at":"2026-08-15T16:52:36.278029Z","title":"Probing Large Language Models from A Human Behavioral Perspective","venue":"cs.CL","work_id":"80ffcb47-b6d2-4c78-b201-da477f6019cc","year":2023},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.179290Z"},"links":{"cited_paper":"/paper/2310.05216","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:a370936748b7910f4a2b5bc4dee58a0f727050ef28ba79ec53d952b1eb8f7576","observation_id":"18fb96d7-d4d9-42c1-b8ab-86104187e19a","resolution":{"observed_at":"2026-08-15T16:52:36.283848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11863","last_updated":"2024-04-01T08:33:11Z","snapshot_observed_at":"2026-08-16T16:56:34.956611Z","submitted_at":"2024-02-19T06:11:28Z","title":"How Interpretable are Reasoning Explanations from Prompting Large Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11863","snapshot_observed_at":"2026-08-15T16:52:36.183560Z","title":"How interpretable are reasoning explanations from prompting large language models? arXiv preprint arXiv:2402.11863,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.183560Z"},"links":{"cited_paper":"/paper/2402.11863","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:ae12b87a4fac46433db558826bb8b1ca50013a552cf458c97a45e7eb9eb21060","observation_id":"943f7d77-626a-4680-ac2d-994b9cd7e972","resolution":{"observed_at":"2026-08-15T16:52:36.183560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-15T16:52:36.187710Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.187710Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:f0082c25274e58b5ffecd6f455d9a252086f1c3c60f83cf3c73d91681409becf","observation_id":"28f9fed7-a112-4e81-b7ec-e4fa5bb813b0","resolution":{"observed_at":"2026-08-15T16:52:36.187710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-15T16:52:36.195441Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.195441Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:2fcda357de38aafd9afc679897aeb27829e01bb2d46a331fb1582b60494c0b05","observation_id":"49d9567f-a6ef-4923-90d6-94a88b39e795","resolution":{"observed_at":"2026-08-15T16:52:36.195441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20526","last_updated":"2024-10-27T17:33:49Z","snapshot_observed_at":"2026-08-20T06:06:39.277314Z","submitted_at":"2024-10-27T17:33:49Z","title":"Llama Scope: Extracting Millions of Features from Llama-3.1-8B with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20526","snapshot_observed_at":"2026-08-15T16:52:36.140415Z","title":"Llama scope: Extracting millions of features from llama-3.1-8b with sparse autoencoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.140415Z"},"links":{"cited_paper":"/paper/2410.20526","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:ca82db10b7d5b3392d330bc579ea58012930bacf4042496974e73123d36ec69a","observation_id":"7039e817-5b59-4788-9ce7-54c877c062e8","resolution":{"observed_at":"2026-08-15T16:52:36.140415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T16:52:36.102274Z","title":"Qwen technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.102274Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:3d18eaf2389cc7e4130661017b12c9e2b91d4310c6f6e9487e20d8baf10ace8c","observation_id":"6399d9f2-939c-4928-a073-41faf76a7ee8","resolution":{"observed_at":"2026-08-15T16:52:36.102274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-15T16:52:36.115943Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.115943Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:3fd2e89ab606d6616a773e4a961a259dd6b0c77e15c9c3c083914411fb61f544","observation_id":"ec95d0d9-3213-41fb-bdc4-79c81d0e13ce","resolution":{"observed_at":"2026-08-15T16:52:36.115943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:52:36.462808Z","title":"A structural probe for finding syntax in word representations","venue":null,"work_id":"d4457adf-a407-41dd-8c76-bb86f67eb025","year":2019},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.148732Z"},"links":{"citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:a93c6c7e839c4051763f2704d411f468ba8efcab23c73c85bb55827798fda70f","observation_id":"97284a95-1243-46a2-99f3-ea0cc0e78305","resolution":{"observed_at":"2026-08-15T16:52:36.467111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-15T16:52:36.191653Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.191653Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:9288b4e96e8c300131ca87589208d82751226d60d9e311c249a28015d4fe1ba8","observation_id":"19697ec8-1d39-4cfa-9c0f-2a9f8313185c","resolution":{"observed_at":"2026-08-15T16:52:36.191653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04236","last_updated":"2024-06-06T16:35:36Z","snapshot_observed_at":"2026-08-20T02:38:10.118500Z","submitted_at":"2024-06-06T16:35:36Z","title":"Understanding Information Storage and Transfer in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04236","snapshot_observed_at":"2026-08-15T16:52:36.107721Z","title":"Understanding information storage and transfer in multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.107721Z"},"links":{"cited_paper":"/paper/2406.04236","citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:8b87e96af54b08fcb6d6ac99f86f8d8e1e1178265bfe233178ba78ee96a2216d","observation_id":"7a797298-bb6d-4bbe-a6d1-86b7ea7bc952","resolution":{"observed_at":"2026-08-15T16:52:36.107721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:52:36.111933Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T16:52:36.111933Z"},"links":{"citing_paper":"/paper/2508.20279"},"observation_digest":"sha256:1a017cc76d61b1a2c02296f849dcedfd67e81dc80eabdd4d2d936790d9d5495e","observation_id":"084f4cdc-dce6-41c9-98e9-189511aebde8","resolution":{"observed_at":"2026-08-15T16:52:36.111933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.20279","last_updated":"2025-08-27T21:22:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T06:10:40.004236Z","submitted_at":"2025-08-27T21:22:01Z","title":"How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 3 inbound Pith citation observations for arXiv:2508.20279."}