{"as_of":"2026-08-05T22:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e66e613d85db511cfc56fa476735d71454d7fcddae3c3bf920de0a8000f7a25","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:52:50.173749Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":33,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2502.16060","last_updated":"2026-05-13T18:23:24Z","snapshot_observed_at":"2026-07-06T20:40:52.927048Z","submitted_at":"2025-02-22T03:32:36Z","title":"Tokenizing Single-Channel EEG with Time-Frequency Motif Learning","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T01:51:12.410547Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2502.16060"},"observation_digest":"sha256:0933a782a42a2741691dd037d66b4e2ce7729a32326bfc67c014152b7dcdea6a","observation_id":"3b082036-cdca-4917-a35f-22c8a6e019fe","resolution":{"observed_at":"2026-05-23T01:52:22.906252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2504.06925","last_updated":"2025-04-09T14:33:59Z","snapshot_observed_at":"2026-08-01T08:33:08.700504Z","submitted_at":"2025-04-09T14:33:59Z","title":"Are Vision-Language Models Ready for Dietary Assessment? Exploring the Next Frontier in AI-Powered Food Image Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T20:01:40.341832Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2504.06925"},"observation_digest":"sha256:fcb4d904ac2b766f9fc2a1a4b7b051b9e9ba70f55b440f688af5a34bc31019f4","observation_id":"37f0f4cb-86c4-49a2-9f8e-4811e7b9aea8","resolution":{"observed_at":"2026-05-22T20:02:02.040008Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2505.17352","last_updated":"2026-05-15T19:17:17Z","snapshot_observed_at":"2026-07-06T21:28:57.440918Z","submitted_at":"2025-05-23T00:08:49Z","title":"Alignment and Safety of Diffusion Models via Reinforcement Learning and Reward Modeling: A Survey","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T02:28:23.754561Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2505.17352"},"observation_digest":"sha256:42067bc4be4a1acf6eb5f8acd276b0dfe14d96fcd829e6cecebe4fc4d56f91b6","observation_id":"e477ded6-793c-414a-9b5e-fdc7025c97eb","resolution":{"observed_at":"2026-05-22T02:30:56.274186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T19:52:50.173749Z","title":"An introduction to vision-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-05T19:52:49.412846Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.173749Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:d3a7d64b668c35176c6e6ce508105e2a8977131692968e4aab76bb786c3aac6e","observation_id":"37c161bf-3b75-408d-9fc4-df691ab59ba6","resolution":{"observed_at":"2026-08-05T19:52:50.173749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T18:34:03.752959Z","title":"Bordes, R.Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14504","last_updated":"2025-08-20T07:53:13Z","snapshot_observed_at":"2026-08-05T18:33:59.422562Z","submitted_at":"2025-08-20T07:53:13Z","title":"PB-IAD: Utilizing multimodal foundation models for semantic industrial anomaly detection in dynamic manufacturing environments","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T18:34:03.752959Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2508.14504"},"observation_digest":"sha256:5d43e1840bdec3768594bc866fb315c0d2a93d477c536f2761412a3b2973961a","observation_id":"1d795958-303e-4ac8-ac8a-1b2bf58114cd","resolution":{"observed_at":"2026-08-05T18:34:03.752959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-04T16:37:24.093410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12752","last_updated":"2026-06-10T12:19:54Z","snapshot_observed_at":"2026-08-04T16:37:21.461167Z","submitted_at":"2025-09-16T07:14:22Z","title":"Participatory AI: A Scandinavian Approach to Human-Centered AI","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T16:37:24.093410Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2509.12752"},"observation_digest":"sha256:ca4456f054339557f013195fcec04546a720163dfaf6d0d8f9957dfe7ab2699e","observation_id":"9eba8e9f-92ec-4e2a-938e-1ec9ae5e8812","resolution":{"observed_at":"2026-08-04T16:37:24.093410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2509.21979","last_updated":"2026-05-17T21:57:50Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T07:02:22Z","title":"Benchmarking and Mitigating Sycophancy in Medical Vision Language Models","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T14:03:41.489520Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2509.21979"},"observation_digest":"sha256:bb422625de4ff597ab36c561814e7bd29a2e6802fe4b9546c77b5625d702d40d","observation_id":"afcc685e-3e51-4df1-a6db-8eada6c4fc77","resolution":{"observed_at":"2026-05-18T14:06:27.386473Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2509.21979","last_updated":"2026-05-17T21:57:50Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T07:02:22Z","title":"Benchmarking and Mitigating Sycophancy in Medical Vision Language Models","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T21:29:52.725437Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2509.21979"},"observation_digest":"sha256:17565e7e759bde82d1f72905dd13c7dec653f36aa1763d44d05c35fee470a546","observation_id":"ac7ff740-6789-4f54-abf9-65dd268a643a","resolution":{"observed_at":"2026-05-21T21:30:39.342101Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-04T12:55:35.208142Z","title":"An introduction to vision-language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-04T12:55:33.661576Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:35.208142Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:c0f3e72cf47f716175e5dd9bacdc41a0d99e84458e62c1705934e9c1e464e666","observation_id":"e592f8e0-fd7f-4609-988e-70e8a3a81a67","resolution":{"observed_at":"2026-08-04T12:55:35.208142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2510.25404","last_updated":"2026-05-15T12:58:13Z","snapshot_observed_at":"2026-07-06T22:34:23.736456Z","submitted_at":"2025-10-29T11:21:55Z","title":"SemanticOpt: Towards LLM-Based Semantic Black-Box Optimization","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T20:14:30.658631Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2510.25404"},"observation_digest":"sha256:e2c7627946a032a38c94d13d3adc9217f6c30650bb9adb82e697b429462f4e00","observation_id":"4f6642ec-0864-46de-bd20-303bad458ba4","resolution":{"observed_at":"2026-05-21T20:15:34.195019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2511.08439","last_updated":"2026-04-13T23:36:15Z","snapshot_observed_at":"2026-08-05T11:00:30.549399Z","submitted_at":"2025-11-11T16:42:47Z","title":"Dataset Safety in Autonomous Driving: Requirements, Risks, and Assurance","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T23:32:23.036776Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2511.08439"},"observation_digest":"sha256:fbcb85664c4eb09ff66123c03520c276eac1f6158fbb6632e5417a0fa268db9f","observation_id":"014b06b0-984d-478c-844f-bb2a82dd5fec","resolution":{"observed_at":"2026-05-17T23:35:31.620155Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2511.13131","last_updated":"2026-04-17T03:37:10Z","snapshot_observed_at":"2026-07-29T19:47:32.070759Z","submitted_at":"2025-11-17T08:34:41Z","title":"MM-Telco: Benchmarks and Multimodal Large Language Models for Telecom Applications","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T22:06:30.391838Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2511.13131"},"observation_digest":"sha256:4c2be46120bd72e31e99f42f641e417b5b46bebdb4e33aebb0c17384c57a30f2","observation_id":"a53208cc-d842-4f79-aa9d-61583ef1bbc4","resolution":{"observed_at":"2026-05-17T22:10:23.017736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-03T07:06:01.235221Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21173","last_updated":"2026-06-30T15:51:54Z","snapshot_observed_at":"2026-08-05T21:50:05.093934Z","submitted_at":"2026-01-29T02:18:24Z","title":"Multimodal Benchmark for Safety Assessment in Industrial Inspection Scenarios","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T07:06:01.235221Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2601.21173"},"observation_digest":"sha256:bde04c87c8ff07de3eaa8dbae0c50c898b9a608e658e8d39e71f74e7b51a6afe","observation_id":"98e4998f-f086-4e26-a339-f68753379d5e","resolution":{"observed_at":"2026-08-03T07:06:01.235221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2604.05210","last_updated":"2026-04-06T22:10:05Z","snapshot_observed_at":"2026-07-06T22:54:00.211106Z","submitted_at":"2026-04-06T22:10:05Z","title":"Integration of Object Detection and Small VLMs for Construction Safety Hazard Identification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T19:20:29.951227Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2604.05210"},"observation_digest":"sha256:e391275183a1f3b1b9f09d8c30c7c005807d21e4f4a01aaf798f087e3ee75d92","observation_id":"ec9c2555-0500-494c-9341-1069322bbfd9","resolution":{"observed_at":"2026-05-10T19:20:44.349250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2604.14074","last_updated":"2026-04-15T16:44:57Z","snapshot_observed_at":"2026-08-02T22:45:50.503012Z","submitted_at":"2026-04-15T16:44:57Z","title":"Training-Free Semantic Multi-Object Tracking with Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T14:12:08.080882Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2604.14074"},"observation_digest":"sha256:c9ee4c319500dd617bd409bf4826dadbfbd24a3f0dc0cc36d8085c607915bb43","observation_id":"0167d732-4c69-4cfa-a2d9-826ec5b2fd21","resolution":{"observed_at":"2026-05-10T14:15:29.939248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-07-06T23:07:14.243878Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T23:56:02.856878Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:cff5bb194654c06199b32b22adda36402f24e36240d98785f9a904fc97c1e05e","observation_id":"609f6644-2f72-43f1-aaf2-e9cd7e91ac6b","resolution":{"observed_at":"2026-05-11T13:51:05.090330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-07-06T23:07:14.243878Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:ebbc45ea48f521f08955e28c4693341394a9e5a418d7a631ec795805989ab7ff","observation_id":"d795f7b7-fd97-412b-8678-9d9a03b447c6","resolution":{"observed_at":"2026-05-22T10:36:24.996880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.01284","last_updated":"2026-05-23T16:17:37Z","snapshot_observed_at":"2026-08-02T07:59:54.107863Z","submitted_at":"2026-05-02T06:40:42Z","title":"Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T14:47:15.946199Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.01284"},"observation_digest":"sha256:2a2c78f84adad047ad4dceb2fbde36625e5487219631601b03804680676ce56d","observation_id":"a0208140-b0dc-4ef4-96d6-2bff8399a3d7","resolution":{"observed_at":"2026-05-11T16:51:07.535999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.01284","last_updated":"2026-05-23T16:17:37Z","snapshot_observed_at":"2026-08-02T07:59:54.107863Z","submitted_at":"2026-05-02T06:40:42Z","title":"Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T00:41:00.814875Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.01284"},"observation_digest":"sha256:1403f477375416a8408dda01648cc44259de040c1a5c3b268f3b96caa0e7ae0b","observation_id":"06721989-116b-487b-9ad6-e4eb181b9e3b","resolution":{"observed_at":"2026-07-01T00:45:11.956542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.01359","last_updated":"2026-05-02T10:08:10Z","snapshot_observed_at":"2026-08-02T20:31:00.269826Z","submitted_at":"2026-05-02T10:08:10Z","title":"Structural Ranking of the Cognitive Plausibility of Computational Models of Analogy and Metaphors with the Minimal Cognitive Grid","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-09T14:33:11.033906Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.01359"},"observation_digest":"sha256:ab4d455024552d6f187afac6b130fcdd8b307cde01df4193a435b9603c25323d","observation_id":"b1016b3c-194d-4f9a-aefc-441cbc6bac8f","resolution":{"observed_at":"2026-05-11T16:56:06.159239Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.02946","last_updated":"2026-05-01T11:54:55Z","snapshot_observed_at":"2026-07-31T02:35:59.178763Z","submitted_at":"2026-05-01T11:54:55Z","title":"RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T19:22:00.217729Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.02946"},"observation_digest":"sha256:13fd6772120e280fec610652c5072c40f0c27c8a67a43276df0e242e6b1ae66f","observation_id":"67009cba-1eca-428b-b224-5b63e7f14042","resolution":{"observed_at":"2026-05-11T15:46:16.515490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.03426","last_updated":"2026-05-05T07:02:50Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T07:02:50Z","title":"Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-07T04:07:58.031100Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.03426"},"observation_digest":"sha256:0dd663ba8996808f2c6ab28f77a07dbfb05472ca32e2629ebdc36854f29f21a6","observation_id":"6d8915a2-f183-4658-be7b-56b5b612884a","resolution":{"observed_at":"2026-05-12T10:41:30.843174Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.07123","last_updated":"2026-05-08T01:56:38Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:56:38Z","title":"Convergence and Emergence of In-Context Reinforcement Learning with Chain of Thought","version":1},"reference_index":191,"source":"arxiv_source","source_observed_at":"2026-05-11T01:15:41.980346Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.07123"},"observation_digest":"sha256:7901868778065d2a1b2f9ed5601bc073175c57d2f9df3da676f5547cdf7c1c7d","observation_id":"64829ab6-3694-4ad2-8790-09329dab8a1a","resolution":{"observed_at":"2026-05-11T04:31:00.589358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.07333","last_updated":"2026-05-17T05:49:21Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T06:37:51Z","title":"Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning","version":1},"reference_index":220,"source":"arxiv_source","source_observed_at":"2026-05-11T01:13:34.836246Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.07333"},"observation_digest":"sha256:8d9e6800ccea341fbfa77515091909449c6baea311ce56c3cddcdc15baf958f6","observation_id":"139fe1bd-0a75-4c58-86fb-af0687f16340","resolution":{"observed_at":"2026-05-11T04:35:58.657864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.07333","last_updated":"2026-05-17T05:49:21Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T06:37:51Z","title":"Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning","version":2},"reference_index":223,"source":"arxiv_source","source_observed_at":"2026-05-20T23:26:35.072127Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.07333"},"observation_digest":"sha256:e1d5205f1d4b13d2208e6b51f2bb7ac552456b407d9268dfe81021413e612f38","observation_id":"3ed98cbe-2c1e-469d-8e94-9df909871a60","resolution":{"observed_at":"2026-05-20T23:29:13.098615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.08962","last_updated":"2026-05-09T13:59:27Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:59:27Z","title":"MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T02:04:07.344134Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.08962"},"observation_digest":"sha256:59874dfe28011060a35b8055df51fa6f6cbbdc4e6e4b8b7b662000b66d49429f","observation_id":"41ef5036-b2f7-4edb-9ccd-dffbd6074067","resolution":{"observed_at":"2026-05-12T02:06:14.962691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.14845","last_updated":"2026-05-14T13:53:28Z","snapshot_observed_at":"2026-08-02T18:56:27.360045Z","submitted_at":"2026-05-14T13:53:28Z","title":"Exploring Vision-Language Models for Online Signature Verification: A Zero-Shot Capability Study","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T21:34:33.366046Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.14845"},"observation_digest":"sha256:1c5f0840dbcfa29c4da04f914c17261834c808b27d142bef5648882016ec8c35","observation_id":"345adb82-6668-4a01-b947-59b133cf7e3f","resolution":{"observed_at":"2026-06-30T21:35:04.165472Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T09:34:45.186929Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:f587d35f312cbd421f7f67ef21f6c50aa0bddaad1f6d835345601218102ae32f","observation_id":"c4ac9317-8b87-410f-85d0-08dd67859fb9","resolution":{"observed_at":"2026-05-20T09:38:11.242061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T18:42:01.854481Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:f3a0d03495f608149dc82b0dba28e712b8b8698e43be97e2bbd35a5059c68cec","observation_id":"611cdf40-cefa-4b14-b0fe-b5ac6fbc5af9","resolution":{"observed_at":"2026-06-30T18:45:00.454252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.18455","last_updated":"2026-05-18T14:20:21Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:20:21Z","title":"OrganicHAR: Towards Activity Discovery in Organic Settings for Privacy Preserving Sensors Using Efficient Video Analysis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T08:37:44.181899Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.18455"},"observation_digest":"sha256:1148d5bb593424b97cb9073f4502687e05454290c112f00e2d52b8941f3eae22","observation_id":"4ce1209c-38ff-4805-bc82-4ec33f26eabe","resolution":{"observed_at":"2026-05-20T08:38:08.917795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.20837","last_updated":"2026-05-20T07:27:08Z","snapshot_observed_at":"2026-08-02T14:27:18.575129Z","submitted_at":"2026-05-20T07:27:08Z","title":"ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T04:55:40.370796Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.20837"},"observation_digest":"sha256:3461efd40410a7eea42b71e78a0f55103f29366d32beff196b54b875826d86d0","observation_id":"2606c9dd-8328-468a-ab13-18bcf3c354c7","resolution":{"observed_at":"2026-05-21T04:59:36.551480Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-07-13T15:09:20.426018Z","title":"An introduction to vision-language modeling.arXiv preprint arXiv:2405.17247, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.23908","last_updated":"2026-05-27T01:19:27Z","snapshot_observed_at":"2026-07-16T23:17:52.153855Z","submitted_at":"2026-04-01T02:44:54Z","title":"In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T15:09:20.426018Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.23908"},"observation_digest":"sha256:27cc2064f4c8d0749c9f8e84093505e01d634047da8933f67fb6ac0aef6c4385","observation_id":"5769037e-ae06-4c74-b7a1-3930efef51f8","resolution":{"observed_at":"2026-07-13T15:09:20.426018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.24019","last_updated":"2026-05-20T06:11:25Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-20T06:11:25Z","title":"MGVQ: Synergizing Multi-dimensional Sensitivity-Aware and Gradient-Hessian Fusion for Vector Quantization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T17:36:45.807397Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.24019"},"observation_digest":"sha256:d217c78329d22e68a624f4ab1e105a88cab2cadd1c780da293be1580bbcb6be2","observation_id":"868b1f91-27a2-4dce-b9fd-1f3d632df916","resolution":{"observed_at":"2026-07-01T15:05:48.331211Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2605.27885","last_updated":"2026-05-27T03:08:12Z","snapshot_observed_at":"2026-08-01T20:55:35.689017Z","submitted_at":"2026-05-27T03:08:12Z","title":"Reflective Dialogue between Teacher and Solver Agents for Video Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T13:51:13.952689Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2605.27885"},"observation_digest":"sha256:5174e9f02cac0d7766908c4abb2d10771f4491104b7b4ace203acc4eb53a7ab8","observation_id":"8b35ea78-0da1-4a70-b4bb-8e2abc571a02","resolution":{"observed_at":"2026-06-29T13:53:28.533978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2606.01671","last_updated":"2026-06-01T04:28:44Z","snapshot_observed_at":"2026-08-02T05:29:24.680380Z","submitted_at":"2026-06-01T04:28:44Z","title":"When Meaning Travels: A Granular Lens on Hybrid-MoE's Role in Idiomatic Understanding for Language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-28T15:19:26.983760Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2606.01671"},"observation_digest":"sha256:899ad69365fbb1c515a752b4569f5c1ca9082d83fabe244e6762a16333ee90a8","observation_id":"241d9055-55a0-43a5-a2ed-e51a8dffe4f4","resolution":{"observed_at":"2026-07-01T22:36:16.768958Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2606.07779","last_updated":"2026-06-05T18:45:25Z","snapshot_observed_at":"2026-08-04T23:22:25.185042Z","submitted_at":"2026-06-05T18:45:25Z","title":"Do Vision-Language Models See Dwarf Galaxies the Way We Do?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T20:38:55.736579Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2606.07779"},"observation_digest":"sha256:5cce278e5b433879288df5e07b888a5127390ca0810ebf15a0988118650000ac","observation_id":"507bac3a-e05b-4116-b4a8-d487dc2cf2fe","resolution":{"observed_at":"2026-06-27T20:41:14.111928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2606.07861","last_updated":"2026-06-05T21:49:34Z","snapshot_observed_at":"2026-08-02T02:56:55.871904Z","submitted_at":"2026-06-05T21:49:34Z","title":"The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T21:58:53.702009Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2606.07861"},"observation_digest":"sha256:8ab38e376e922da9c0afc2668587df28c39bc527a791c626ee3a21af7bde1a34","observation_id":"1be23868-cf52-4436-9ba2-f28b4c4a4b5b","resolution":{"observed_at":"2026-07-02T17:37:14.457798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2606.27660","last_updated":"2026-07-01T13:33:39Z","snapshot_observed_at":"2026-07-07T00:01:49.598947Z","submitted_at":"2026-06-26T02:33:20Z","title":"MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T05:08:46.145616Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2606.27660"},"observation_digest":"sha256:cb9bc0955ccaa95ec45aacc95583aab272aeac1c69f74c9c499f9999144432f3","observation_id":"6f66c2dc-4e0f-4493-9bfe-9700d3f1d54c","resolution":{"observed_at":"2026-06-29T18:23:51.147850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2606.27660","last_updated":"2026-07-01T13:33:39Z","snapshot_observed_at":"2026-07-07T00:01:49.598947Z","submitted_at":"2026-06-26T02:33:20Z","title":"MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-02T21:35:33.280591Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2606.27660"},"observation_digest":"sha256:4258b91672bfacfae2fd6188f5cc3053712414850871205a7e6275a09b4676c2","observation_id":"c5efc954-3b99-47c8-b3d0-7f7bef75eb2f","resolution":{"observed_at":"2026-07-02T21:37:24.221809Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2606.31204","last_updated":"2026-06-30T06:33:55Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T06:33:55Z","title":"AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T06:12:59.736399Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2606.31204"},"observation_digest":"sha256:a2993d1a6564c37047be152a9fc4fdd4c69e9b068461040b595b8a460c8e88a4","observation_id":"23b8b264-c111-48ef-8bf9-e0996208d565","resolution":{"observed_at":"2026-07-01T09:45:40.416228Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-07-11T21:58:20.755128Z","title":"arXiv , author =:2405.17247 , primaryclass =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04061","last_updated":"2026-07-05T00:13:12Z","snapshot_observed_at":"2026-08-02T21:30:41.068382Z","submitted_at":"2026-07-05T00:13:12Z","title":"Telescope: Improving Zero Shot Detection of LLM Generated Content By Measuring Token Repetition Probability","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-11T21:58:20.755128Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2607.04061"},"observation_digest":"sha256:45c63877b64187ddb40459a7c2ea1f4c6f3f963c438db5281f94cbaf8cc53cb8","observation_id":"32fb74ae-2b89-4919-99a6-1c50e2db20af","resolution":{"observed_at":"2026-07-11T21:58:20.755128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"An introduction to vision-language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-07-11T16:28:31.303814Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:5a65065172401e618727200f1697d424ca44ecc913e137e1b43b3d46e31c3b7f","observation_id":"5e7f0901-94d9-4cb5-aa69-c894d17338f2","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-07-11T07:12:02.239732Z","title":"Bordes, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05369","last_updated":"2026-07-06T17:47:31Z","snapshot_observed_at":"2026-08-02T12:16:22.220239Z","submitted_at":"2026-07-06T17:47:31Z","title":"GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T07:12:02.239732Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2607.05369"},"observation_digest":"sha256:7772d00ea20b535f5cda2b2bba6484ead157942c5a920ef8dcc6d17bae5cb985","observation_id":"911ec530-27fe-4e8b-b0d2-036f862cecbe","resolution":{"observed_at":"2026-07-11T07:12:02.239732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.17247/citation-record","integrity":"/paper/2405.17247/integrity","json":"/paper/2405.17247/citation-record.json","paper":"/paper/2405.17247"},"outbound":[],"paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2405.17247."}