{"as_of":"2026-08-06T18:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:84f9a1303cdd88b892ddded441de9671f36d8682f01846280c10d5e645312875","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T00:17:46.528896Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03738/citation-record","integrity":"/paper/2607.03738/integrity","json":"/paper/2607.03738/citation-record.json","paper":"/paper/2607.03738"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Possible Principles Underlying the Transformation of Sensory Messages","venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:fb069a249667058c5f2391075f0c8981be287e7e475643967a88d37fa5b92326","observation_id":"08fa7a93-aaae-46e4-8fef-3656a45d7d9d","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"DEX-AR: A Dy- namic Explainability Method for Autoregressive Vision-Language Models.arXiv preprint arXiv:2603.06302, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:4c6bcd9e28d0d25cfac01108dbbac4f1011c9fb8d0f49f060a3e1d392dad10c0","observation_id":"cbaa9ab6-6293-4a71-95f3-0b4c700d7d3f","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation.arXiv preprint arXiv:2509.22496, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:25e7f9f5957525394cd3c34d9388e38c5172de8578319849921a34e5ebe9fea9","observation_id":"e356a26e-3e6a-4388-bbe1-7c7bb08cb03a","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"What Does BERT Look At? An Analysis of BERT’s Attention","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:d33a0b766a0a3121aa43186c03e3086f44470ce1eb881ba66bef3ef8576e24b8","observation_id":"328f21a5-5036-48f6-8417-501111917bd9","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Training Verifiers to Solve Math Word Problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:003d850f9665d4d0debd978eb99d77d1aa9892f63c6acae0788d4deda6b9ee1b","observation_id":"01ef25fe-f403-4a05-b5cd-fcbf9b1d5c5d","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Flashattention: Fast and Memory-efficient Exact Attention with IO-Awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:44cebb987db8fe3b546adea1d77aab494876c9a18aafa98e3022802d5aa9737b","observation_id":"4e76bd23-0bf3-48ce-85b6-1d6c4a37c165","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition At Scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:873a3e7ecf31eacad3328a7fc5dc61c76d9153f96309d966d2d21897b4f684b9","observation_id":"1cc264bf-6317-480b-b40a-ffccdf5af6a3","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"A Mathematical Framework for Transformer Circuits.Transformer Circuits Thread, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:e799b2dd23c1821b6f595ad7a2509b6f719e6eb94e3b823cd5de368031529800","observation_id":"e01c8e83-32e3-4ec4-8252-5e6c76fe734e","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-07-06T13:54:56.779166Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Toy Models of Superposition.arXiv preprint arXiv:2209.10652, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:b79709a48f0d80c3d767fcf0e3b71828b71c4f063b93ede596b0ed1c7a14301c","observation_id":"a51830b2-a3c7-4472-99f1-d8d35a38e971","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:db2f3160a450cbf782bec5b919c722183455afaf2c1ea3f87001fbed6ab08b88","observation_id":"255440bb-5c44-433f-9068-34e0d571fefb","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Dissecting Recall of Factual Associations in Auto-regressive Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:74dfaa6c05763ea04275ea40687b09f4c155ef2f94e39c7079b0898379ce689e","observation_id":"40dc75b4-0d16-487a-91fe-7c6b987a25d7","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"LLMSteer: Improving Long-Context LLM Inference by Steering Attention on Reused Contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:c39176599098313409692af6ed045f77605c0fa3facc91ae12ed020b60d13fc9","observation_id":"91ac1e6f-8735-46c2-916a-6a7bb33a924a","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T14:17:58.058583Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01790","snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?arXiv preprint arXiv:2507.01790, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"cited_paper":"/paper/2507.01790","citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:eb2ac82040686d69318f119125349a86f270b647aa45229d8f78f32adea2d589","observation_id":"218f5833-c688-4f6d-b7e9-af96fcff062a","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Opera: Alleviating Hallucination in Multi-modal Large Language Models via Over-Trust Penalty and Retrospection-allocation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:3cb7521e5f172bc9e72b26fda6b03179a624e363f8c33810d781efe7a58b905c","observation_id":"cf0ca37f-581a-487d-84b3-d3a5906274c6","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"The Platonic Representation Hypothesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:82374d0389413872cc61f7d0d146fb4bb7ddb43bb45b4698f5f4b3a2640c854c","observation_id":"8ef6b9de-9153-46ef-85ef-45280e840622","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"What’s in The Image? A Deep-Dive Into the Vision of Vision Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:d41540197740a2d9ee0de9632fbb4e36c3159af391d4a04afb8946c9408a287c","observation_id":"96b94612-2c44-4e77-9062-bd2694f9f545","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:7a130d00c1658049ea0782fa13497ce8bc3cb783250051f4d56d55cfe5bc0c45","observation_id":"b215ee15-3dfa-4098-8ee6-3d945a17fa6b","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"The Open Images Dataset V4: Unified Image Classification, Object detection, and Visual relationship detection at Scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:46c76d6e3eac36e3780f21ad921c4757fa899cd01854c9c65d8969b8383a8fb3","observation_id":"7fffb951-82e2-4faf-b8b3-305bea08cfc9","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"LLaV A-OneVision: Easy Visual Task Transfer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:b616df6cae071dcfb0bacbfed2b4791ecf9282005de7e715904edbd8572430f3","observation_id":"d84c590e-5e3c-4800-bf06-386a799c9d56","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14204","last_updated":"2025-01-24T03:20:37Z","snapshot_observed_at":"2026-07-06T20:25:22.313860Z","submitted_at":"2025-01-24T03:20:37Z","title":"Dynamic Token Reduction during Generation for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14204","snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Dy- namic Token Reduction During Generation for Vision Language Models.arXiv preprint arXiv:2501.14204, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"cited_paper":"/paper/2501.14204","citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:979ab4fa016f0ce886b51614535634c2a181e76698ff8ee34122e941ae6a115b","observation_id":"977d2468-8378-4443-8248-fc8081ad1199","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Paying More Attention to Image: A Training-free Method for Alleviating Hallucination in LVLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:a3a2beaf381224eab862ebbe83bc2d3eba01497bafbba47d52cb786cbbde01d7","observation_id":"53c7fdd9-37a2-492c-a278-24b313ed3881","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Vision-language Models Create Cross-modal Task Representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:bf3c2d2b522df9136b88326a1e159556e3117178e3eb66ff41966a31c62163ac","observation_id":"6cc6c3e1-9ce9-42d9-88c1-e04dfdfd7a77","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Revealing and Enhancing Core Visual Regions: Harnessing Internal Attention Dynamics for Hallucination Mitigation in LVLMs.arXiv preprint arXiv:2602.15556, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:9404308c0588b408dd23fac09b4908670d5715175e5cf5af201b172aece2cf8d","observation_id":"d0593d9f-a0d8-4701-90f4-ee1c85f081b7","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Chartqa: A Benchmark for Question Answering About Charts with Visual and Logical Reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:7494dd8aea7bbe0f1eeba3a997435a1b8bde822985642633d6791ab9ebc3a669","observation_id":"9dd6ebce-b692-414a-9650-585960a38667","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:d1e3900d124a8060b4b51fc2d535321c574b9ab5d1b4db836661022b75f85632","observation_id":"8ee55ee0-5c34-45fb-b29c-d0f3e4c9a057","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Same Task, Different Circuits: Disentangling Modality-Specific Mechanisms in VLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:cdb5cb90d8af95393fc373e7695ffb2babbbeb894574880f74129d3709744d30","observation_id":"064b8b0c-de79-4c92-903a-a1c03b51a728","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Token-wise Decomposition of Autoregressive Language Model Hidden States for Analyzing Model Predictions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:50c141387952feca3a902047265ce950de77901d091b33623b96735494f924f3","observation_id":"9e7748e5-bde2-4454-b870-f7bdc1c5caae","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Mixed Signals: Decoding VLMs’ Reasoning and Underlying Bias in Vision-language Conflict","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:160a683f30600c31360dc68d2474ea52031104cb890ef309dd1ff5d9067cc6bb","observation_id":"6db87029-9da1-41f3-825e-452ed1f597ec","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Seeing Far and Clearly: Mitigating Hallucinations in MLLMs with Attention Causal Decoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:d3a4c51d86748339b1f15bb29f01f7da0a2de75580da085d61534b7684f9b439","observation_id":"70e14a40-542f-4983-8951-cb37a91a1d47","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Attention Is All You Need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:e5ddb158f87de3583cbe7b2bf5a5f6f540d424a8177bf869af4473e790df8932","observation_id":"9b5e3a1b-0c97-4b16-8560-b3fd88e668f1","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"MLLM Can See? Dynamic Correction Decoding for Hallucination Mitigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:ecfc7ac65185bd52f7a73674b72bddeb20b1a5a9cfc30b5b4c2a70bebe9f33f8","observation_id":"dbe5126e-3d39-4a7b-8488-04d39a2ab45e","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"ASCD: Attention-Steerable Contrastive Decoding for Reducing Hallucination in MLLM","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:8af5b4bf6e06a011a87b129df3fff2315a527e5fe77e0cbd51de10048da52845","observation_id":"c0ffc56c-43c1-4b06-8cac-18bcca0798cb","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Measuring Cross-modal Interactions in Multimodal Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:99a2693c34ac1e91b0df6668746bac6ff352934d410a25d13e5c5ec4dfdd279b","observation_id":"0493d441-b936-4d9a-b31a-c812ae6db9ed","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Qwen2 Technical Report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:813e0a2e5c736dc47adb3ce684d5c53c294944cd597deffb47f030e7dfed7d92","observation_id":"4b0ac126-b5b9-4f21-9d6c-567fc5234c06","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Qwen2.5 Technical Report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:35d3f7f5f15b3d76ee135b07d19fb41275ba6a3f3daf0db8dcb58fba54135b38","observation_id":"5da9e978-3edb-434d-b4e7-85b94844be78","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Lifting the Veil on Visual Information Flow in MLLMs: Unlocking Pathways to Faster Inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:12955d72b21806b80e6c4a3f5861ef9a44dbbb087afce9ea815f90721a912985","observation_id":"f0c1f820-2f83-4de0-b8a8-8d8680dd46a4","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13600","last_updated":"2026-05-28T03:40:51Z","snapshot_observed_at":"2026-08-02T23:33:13.904850Z","submitted_at":"2026-02-14T04:44:37Z","title":"SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.13600","snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"AdaVBoost: Mitigating Hallucinations in LVLMs via Token-Level Adaptive Visual Attention Boosting.arXiv preprint arXiv:2602.13600,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"cited_paper":"/paper/2602.13600","citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:9f32a0b29c6db1f79ce83b93af8733ea00fa8c9de183489a143fad72a44aec73","observation_id":"f3b96e57-7054-4b3d-900c-b5529aa7bfbf","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Tell Your Model Where to Attend: Post-hoc Attention Steering for LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:0b895c4ac5138280f90bee0fc479491b889cdb00fc79f4d06299e0cb258530c4","observation_id":"714997e9-62f3-4514-ac7d-ab77b2950a31","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Adaptinfer: Adaptive Token Pruning for Vision-language Model Inference with Dynamical Text Guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:a88d240ffb1fc135ab3d41d3a599292e5f84ea076565cf81581c102140c9dbb6","observation_id":"392a7a09-f0ce-4e1b-897a-0b485d5922c2","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"Cross-modal Information Flow in Multimodal Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:438f8bd7031f8754e3eb0bcd20304c9cff90522aa269ebdff94ffc646576beec","observation_id":"04d4c8a1-6d05-4159-82fe-6e40f215564c","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"The fruit is","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:247f9d35d36d0fb73a04a8dbe0fcc9868168ef5a2c4886c063d9f6e29e68edca","observation_id":"4e904484-1923-4b72-919f-8950b8b4a664","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:8bff4fd5e06b328ddd4a9d7b77eb49531ef4442ac8b9402f67a6d23046b297ea","observation_id":"e741380a-59f3-4af8-a066-82aaf0231b8d","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:31a5798f975978b10ea737207d1eafccb3ea6166db4c56e31169d8aa72a54de3","observation_id":"6f1111c9-50c4-410e-b569-81361cbbf630","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:774df6f39a0e54b72a1d56077712cab638fd540fa50df46667f583b930d897da","observation_id":"b4340adb-fe09-4a85-a1da-bfbc72f0dbc7","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:c10b5a9751ac1ee839416b48eb03e6548c4575e10374685b8fa5ea523696f961","observation_id":"befe447d-60b4-4bbd-938a-f0887912f8de","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:80455d9b78689b3586d99623f35ea7ab85b1717557cc4150bdab561e967fe325","observation_id":"e018c8f3-4fc9-485a-9588-9aa61c6ee5ab","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:ddebbc79d28b4db1237892612b910d8344d4039b6cf4ee9e5dc3017328efd83e","observation_id":"d61ba245-aea7-4cd5-ab76-307396136305","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:58b755135e2c37bf5490ca5ca895a19715fc4239bde4390471c5a612e909ab1b","observation_id":"94695060-afcf-4b9d-9ff2-36289ce43d49","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:e0fd0101839c6b1fe048eec868334080fe3731ac3277eaf020da2174c7c0ba8f","observation_id":"5d3173e9-799c-45d7-a22f-fb2a4f7fb759","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"I see no fruit... it is a cherry","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:b7f66e32815f0ef7f52fe8edce1257a196ad71070794e6c9ad69f1eaf8fa63ed","observation_id":"30d3a132-9d79-4ac7-9673-2ada6ed01cfc","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"fruit_answered","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:ae7f38c6dfe4a5097f83bed798126713db34269f3bb863a77e71388a990c63d6","observation_id":"c0bc0d37-a42d-46ca-a432-23bf3df227c5","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"True” or “False","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:528ae48f1cdced20079e8bd9d77cb40d1a98bd19bb1e5920c7c33e89d195415f","observation_id":"fec51bd9-7d87-4682-9499-38e70ffc5699","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"True” or “False","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:c75a0280a1bbc94d0d21dce4db0118a8c286033ba79d3ce58b712157b6b36ed5","observation_id":"885cb1a8-5677-46ae-9cd5-3e8eb5b7d1ab","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"visual_check","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:fc901c9031534dcf23a173ce254b4b55873a22e7266e1490e381f0e1faa453d0","observation_id":"7db763b5-8f1e-418c-b58c-3b39625c35b8","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T09:03:43.854802Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2607.03738."}