{"as_of":"2026-08-14T16:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce80df8991f380539781f001a6ca4b9e88da7e5da46bff029390ed6058bad714","coverage":[{"denominator":147,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T07:42:22.478647Z","state":"measured"},{"denominator":143,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":143,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:28:26.603246Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T16:39:58.306201Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-12T19:40:42.628347Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.10557","last_updated":"2025-06-28T18:24:35Z","snapshot_observed_at":"2026-08-12T22:12:56.598190Z","submitted_at":"2024-11-15T20:09:59Z","title":"MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T19:40:42.628347Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2411.10557"},"observation_digest":"sha256:eeba7eb0fddcbe803ad1ef0562f7f42483c3f18cb4a708c1fe2b4b533df4d6af","observation_id":"5b4a343d-7fb3-42fe-a459-72d59a9ef5db","resolution":{"observed_at":"2026-08-12T19:40:42.628347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-12T17:21:52.298102Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":147,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:1b298e6f1edbf6824a6807ee0f4f4810eeeb804a4d446c489d968a23b312178a","observation_id":"e86d5a3a-83de-45de-8fdc-b8cae8194041","resolution":{"observed_at":"2026-05-17T20:33:26.913053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-10T23:09:25.074549Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-08-14T04:36:49.170070Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:09:25.074549Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2501.01986"},"observation_digest":"sha256:be3fd60e885ed9407e1dd5ca4fdae0d5653d8f0a4a1a1d3ee218771916c592b4","observation_id":"cbd5ebb6-c646-462d-9ea0-bfbe0c282b7a","resolution":{"observed_at":"2026-08-10T23:09:25.074549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-10T17:08:56.455169Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12553","last_updated":"2025-09-03T02:06:28Z","snapshot_observed_at":"2026-08-11T23:49:55.219151Z","submitted_at":"2025-01-22T00:17:08Z","title":"ViDDAR: Vision Language Model-Based Task-Detrimental Content Detection for Augmented Reality","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:08:56.455169Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2501.12553"},"observation_digest":"sha256:edc4f40e6c3db9ae02c6d8f57887fba7f6d9613a8d3bd760e680f047b75bbc57","observation_id":"dbb8d4ec-71b1-42a0-8a5e-08805a4c0a71","resolution":{"observed_at":"2026-08-10T17:08:56.455169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:e0d2d332872db250d991cdd2c9581bba4e4391f4a09a325a764d03ebffcc79f9","observation_id":"643ac8e0-6a44-48cd-b137-d9331bdd8c8b","resolution":{"observed_at":"2026-05-11T01:19:59.947092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-10T15:35:30.199392Z","title":"Nvila: Efficient frontier visual language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-11T01:32:58.320917Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.199392Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:7b3f940bdcfb776b6d7089c1fb5826da93dcec35d1955ac45e7a6484b3b79be5","observation_id":"d33a54a7-9b41-4224-8a20-4010fe75f9eb","resolution":{"observed_at":"2026-08-10T15:35:30.199392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-10T18:04:34.873401Z","title":"NVILA: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"reference_index":199,"source":"pdf_text","source_observed_at":"2026-08-10T18:04:34.873401Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2501.14818"},"observation_digest":"sha256:bfcf6f637aab651b1c8eeea773ba09aab1cc2b02e0a466a9debdaf721171a8cb","observation_id":"241e713a-6af2-45eb-8fb4-b577a8a5af47","resolution":{"observed_at":"2026-08-10T18:04:34.873401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-09T23:37:12.567981Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-13T17:55:42.231540Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T23:37:12.567981Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2501.18427"},"observation_digest":"sha256:7c9fc0ad7e5ed146274a67a516e9093e1784f32d75dbda9b2701d11ac6eff072","observation_id":"eedac329-4758-4a4c-8b3b-004a336318fa","resolution":{"observed_at":"2026-08-09T23:37:12.567981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-09T15:26:18.906231Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-13T07:38:30.161844Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.906231Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:6c72eff543a5e7fb3a174bfee39b503190a4a0fc85f904dc3b8121aa23cfb307","observation_id":"3a066575-8af0-4f62-a543-226beb93ca90","resolution":{"observed_at":"2026-08-09T15:26:18.906231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-09T12:23:40.532423Z","title":"Nvila: Efficient frontier visual language models, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02406","last_updated":"2025-05-27T21:46:43Z","snapshot_observed_at":"2026-08-10T09:51:24.347747Z","submitted_at":"2025-02-04T15:24:16Z","title":"LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T12:23:40.532423Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2502.02406"},"observation_digest":"sha256:e4db9bf56cb8e3f354c05e02c6c481c3f1a1c7ccf7e3abd455413885f291b1ae","observation_id":"e6297378-2b6d-428a-b06c-488d05e77eee","resolution":{"observed_at":"2026-08-09T12:23:40.532423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-08-12T16:10:35.170069Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T05:53:26.066674Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2502.04326"},"observation_digest":"sha256:c83997c5b1f3d81f7ea71fb24c943be876e2a568f706b8c5076cae751fe51deb","observation_id":"c3c83d3d-f68a-4096-a917-9d2541186504","resolution":{"observed_at":"2026-05-17T05:53:26.341702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T15:34:54.126661Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:54.126661Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:4b5265bc982ff8acbd69df21bffe8a3adcb8113220c83a2a4cd19c942c511e14","observation_id":"b6368733-9fef-477b-b20f-a6c9b9c6ef7a","resolution":{"observed_at":"2026-08-07T15:34:54.126661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T15:13:56.772463Z","title":"Nvila: E fficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-12T02:40:12.935240Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:56.772463Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:711fea7d4ce391b0e89bf4ee4b3501db95ae785f580fd786559ff029cc535a5d","observation_id":"a8dab4d0-57e2-4045-bbef-6ea7cf7dc34d","resolution":{"observed_at":"2026-08-07T15:13:56.772463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T15:02:25.841387Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-13T18:23:58.205884Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:25.841387Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:3960d98adbe697167505899f096839bed1c6615366c1027e216774a4cda63077","observation_id":"65a724fb-6abd-4279-8576-c22f418abf0d","resolution":{"observed_at":"2026-08-07T15:02:25.841387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T14:59:36.482744Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16839","last_updated":"2026-07-15T22:41:27Z","snapshot_observed_at":"2026-08-14T13:42:27.582012Z","submitted_at":"2025-05-22T16:07:12Z","title":"LaViDa: A Large Diffusion Language Model for Multimodal Understanding","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:59:36.482744Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.16839"},"observation_digest":"sha256:04fb026f3ae8f04a02ba97c338f3fbe4010a8e3d2ca03fe1730ca67fc98011f1","observation_id":"b46feefe-1245-44fc-8ce9-c9a71c63c07d","resolution":{"observed_at":"2026-08-07T14:59:36.482744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T14:05:01.704476Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:01.704476Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:a4bf93c96160be30315f2e910160333cf966a2dedc6bb8d87da23c84d021b933","observation_id":"ef6700ac-f5f4-4846-b60a-0cefd3575d1f","resolution":{"observed_at":"2026-08-07T14:05:01.704476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T13:33:56.166173Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21465","last_updated":"2025-05-27T17:36:23Z","snapshot_observed_at":"2026-08-07T16:43:25.522882Z","submitted_at":"2025-05-27T17:36:23Z","title":"ID-Align: RoPE-Conscious Position Remapping for Dynamic High-Resolution Adaptation in Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:56.166173Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.21465"},"observation_digest":"sha256:12877820d99d45a82b616394200d33ca32b176d0cd7e851c0627ed6055d0824c","observation_id":"8a9d3f84-1937-4239-94cd-d89cce996e5c","resolution":{"observed_at":"2026-08-07T13:33:56.166173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T12:48:07.044736Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-09T05:32:01.732887Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:07.044736Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:7fde029ca9b3c1ecbbb533d488405340e497c4bd2095f128456e4cc75fb91c68","observation_id":"b8f94370-a633-46b5-aad4-a98a9265096e","resolution":{"observed_at":"2026-08-07T12:48:07.044736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T12:09:06.218354Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00479","last_updated":"2025-05-31T09:10:43Z","snapshot_observed_at":"2026-08-09T06:24:07.358275Z","submitted_at":"2025-05-31T09:10:43Z","title":"EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:06.218354Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2506.00479"},"observation_digest":"sha256:ee85a3da705a57303396db1987fa8851f7a3d52ed7e60da6698eb115d0baeb0c","observation_id":"df08e76c-feda-4625-aff8-133bf071001d","resolution":{"observed_at":"2026-08-07T12:09:06.218354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T11:59:07.844726Z","title":"Nvila: Efficient frontier visual language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:07.844726Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:8f21f42dbae22846c4d4e0d8fd34fd70cfd258d14c69173f66ea5c1447dc349a","observation_id":"53815c49-612f-4fdc-ace2-72e165abdbdc","resolution":{"observed_at":"2026-08-07T11:59:07.844726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T11:32:10.410916Z","title":"Nvila: Efficient frontier visual language models.arXiv preprint arXiv:2412.04468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02308","last_updated":"2025-06-06T21:40:20Z","snapshot_observed_at":"2026-08-08T03:43:20.316495Z","submitted_at":"2025-06-02T22:55:23Z","title":"MINT: Multimodal Instruction Tuning with Multimodal Interaction Grouping","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:10.410916Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2506.02308"},"observation_digest":"sha256:d8d0312740f97a82a5ab98da94f8b93bdc97435c06cb2ed5bbf9a0d2bb34634e","observation_id":"bc85cb85-975e-4319-8afc-377612f6b484","resolution":{"observed_at":"2026-08-07T11:32:10.410916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T11:12:10.219918Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.219918Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:c55c9bd55de2fa8cbe7806d43c77164caf16e7b0c8caba0748bc03073f5e183a","observation_id":"54f3858b-f0ae-4f61-9f1b-9fe9c8f76c74","resolution":{"observed_at":"2026-08-07T11:12:10.219918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T10:52:35.682714Z","title":"Nvila: Efficient frontier visual language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.682714Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:121a5a4b100bd753209281d7c62e53ad80b264c48865d02be038e8112e94eb38","observation_id":"56673960-7564-4da5-a3a2-2610c81da451","resolution":{"observed_at":"2026-08-07T10:52:35.682714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T10:29:42.990740Z","title":"Nvila: Efficient frontier visual language models.arXiv preprint arXiv:2412.04468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05287","last_updated":"2025-06-05T17:44:12Z","snapshot_observed_at":"2026-08-12T14:24:44.641325Z","submitted_at":"2025-06-05T17:44:12Z","title":"EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:42.990740Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2506.05287"},"observation_digest":"sha256:224fecb4da376db76ddb7beac2bdf6290e1a6e52fcc0281c6a6fb199e3b4b5e6","observation_id":"4e1d889c-7dd5-42e2-af56-33384038d571","resolution":{"observed_at":"2026-08-07T10:29:42.990740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-14T01:52:48.608000Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:c948ea5ce221e671e9a5c449f7812080627c1642c757bd841db465165f409758","observation_id":"e3b33f33-822a-4f75-b31c-5aaa08be4c8f","resolution":{"observed_at":"2026-05-21T04:32:58.776597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T03:18:14.655384Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2507.16815"},"observation_digest":"sha256:9f2b092b5f6601ad8dfe15d5793d05ab6b0ba0859858da4135fc48284435bea2","observation_id":"d9fd4ac1-42a1-4395-ae53-7f3282d22980","resolution":{"observed_at":"2026-05-19T03:22:00.959761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-06T11:49:10.455295Z","title":"Nvila: Efficient frontier visual language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22369","last_updated":"2025-09-02T02:23:20Z","snapshot_observed_at":"2026-08-10T02:09:40.417957Z","submitted_at":"2025-07-30T04:25:14Z","title":"Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:10.455295Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2507.22369"},"observation_digest":"sha256:c617b6cec7e2a3cd2af9fb4b8e0532d13414c05837170a190ace741ee4afa999","observation_id":"94e994f1-c11d-493c-8020-9568fcb97295","resolution":{"observed_at":"2026-08-06T11:49:10.455295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-06T05:36:19.512240Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-14T05:25:32.848348Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:19.512240Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:e3d47be7e74037364b1f96faf8f0c847ce09c7a9d4bbe39626b516e5f267a4de","observation_id":"dcae26e5-9d74-4f1b-b725-9d1175c24896","resolution":{"observed_at":"2026-08-06T05:36:19.512240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-05T19:03:10.742012Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-13T22:53:42.934950Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:10.742012Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:16850438fb479bdb44f8e8db6f9740541e2141d64d1e5898995f4faa656558f4","observation_id":"ae0a074e-4087-4795-8e9b-af2c3d3bd5ea","resolution":{"observed_at":"2026-08-05T19:03:10.742012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2511.17097","last_updated":"2026-04-14T15:21:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T09:52:07Z","title":"Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T21:02:38.013115Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2511.17097"},"observation_digest":"sha256:45f3e6f1d88cd568de0938c12fc8748093a3439e516faab42c9752fa89a8c05e","observation_id":"c91c6ae7-578e-425a-949f-7cf55e871954","resolution":{"observed_at":"2026-05-17T21:05:15.963769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-02T22:27:42.280107Z","title":"Nvila: Efficient frontier visual language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16872","last_updated":"2026-05-27T14:51:57Z","snapshot_observed_at":"2026-08-10T14:44:30.822705Z","submitted_at":"2026-02-18T20:59:22Z","title":"DODO: Discrete OCR Diffusion Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T22:27:42.280107Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2602.16872"},"observation_digest":"sha256:85178afc08ae7668bfd689f74a124a57e72b118da8add63e6a769e6b5655beb1","observation_id":"19fd7d4d-a3e7-43ca-ab85-6c1d59da13d0","resolution":{"observed_at":"2026-08-02T22:27:42.280107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2603.22453","last_updated":"2026-05-18T20:04:23Z","snapshot_observed_at":"2026-08-01T07:56:59.952895Z","submitted_at":"2026-03-23T18:21:23Z","title":"XNote: Benchmarking Automated Community Notes Generation for Image-based Contextual Deception","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T10:39:09.209094Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2603.22453"},"observation_digest":"sha256:9e1bcf5799925e769b2af239015bd7ae0ea84d60626c3c172af47d19a1e9fd25","observation_id":"146ecfb9-4eba-431d-b9dc-8014c112f4e7","resolution":{"observed_at":"2026-05-21T10:40:00.517722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:b3ba37d43bb540fde32ac67a8538c6c184d8668053a9fe775393ff4db56c5e69","observation_id":"2b981b61-9835-4d9f-ad5f-fac46f34d757","resolution":{"observed_at":"2026-05-11T09:41:01.759826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2605.17283","last_updated":"2026-05-17T06:39:05Z","snapshot_observed_at":"2026-08-14T15:06:22.101894Z","submitted_at":"2026-05-17T06:39:05Z","title":"OProver: A Unified Framework for Agentic Formal Theorem Proving","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-20T14:43:46.517807Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2605.17283"},"observation_digest":"sha256:e42c1c22336f059efc535889a028ac1609dafc1c847f7808b2c8a7c8f2923f48","observation_id":"5d3ba47f-3898-46ba-a810-ee075bf51136","resolution":{"observed_at":"2026-05-20T14:48:23.383955Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-07-31T15:52:05.461441Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:d4660c53209a593f89c02c1c55e4cb943c2c85694ce776f070b510ff7cbe6efe","observation_id":"827d637a-0d04-46af-bae8-fcc3215e2e08","resolution":{"observed_at":"2026-05-20T11:58:15.155933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2605.22078","last_updated":"2026-05-21T07:16:45Z","snapshot_observed_at":"2026-08-12T02:06:12.618530Z","submitted_at":"2026-05-21T07:16:45Z","title":"Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T06:16:32.972099Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2605.22078"},"observation_digest":"sha256:f650612125e3b71c5c592cdc5a6e467d833737b9214db4e4510c93a8356d4b29","observation_id":"e9b193be-822e-4e95-b0ae-5d5df97a8910","resolution":{"observed_at":"2026-05-22T06:21:10.873047Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2605.22158","last_updated":"2026-05-21T08:27:15Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:27:15Z","title":"ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T06:16:38.589260Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2605.22158"},"observation_digest":"sha256:856b3fb49cc48cb8ec175680f80c2d3291c9e6fc2d456b4898968e0b9899e10c","observation_id":"e9047406-2dbb-4c90-889d-46404d94c104","resolution":{"observed_at":"2026-05-22T06:21:10.806191Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2606.03787","last_updated":"2026-06-06T15:58:25Z","snapshot_observed_at":"2026-08-04T12:54:34.836345Z","submitted_at":"2026-06-02T15:39:27Z","title":"Worth Remembering: Surprise-Gated Robot Episodic Memory","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T09:37:15.301043Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2606.03787"},"observation_digest":"sha256:5b221fd6c99f751cab9eb630daf4968de68b2cd9fd2b1d13ae403c477d86f45a","observation_id":"f746aa27-d10a-4bf0-87c5-abcb2ad6eb0f","resolution":{"observed_at":"2026-07-02T03:56:34.558067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2606.24477","last_updated":"2026-06-23T12:13:19Z","snapshot_observed_at":"2026-08-14T12:23:59.674478Z","submitted_at":"2026-06-23T12:13:19Z","title":"video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T00:19:26.153682Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2606.24477"},"observation_digest":"sha256:2854375243336d193bf6205ba008be17eeb1e86d8dfa6202dce5cda2a0ff84e2","observation_id":"1cc176a4-3e76-4d97-9237-96526862d2ee","resolution":{"observed_at":"2026-07-04T16:39:58.307382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Nvila: Efficient frontier visual language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-13T01:54:21.304319Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:14d7f72a589f56b5a293b46a4a5f9d7950bce2971cd8664ba95fd1aed9266c04","observation_id":"89826ebe-5819-4ffd-a570-9dbf1521d10b","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-11T17:18:41.284513Z","title":"arXiv preprint arXiv:2412.04468 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04559","last_updated":"2026-07-06T00:19:42Z","snapshot_observed_at":"2026-08-09T14:49:10.281004Z","submitted_at":"2026-07-06T00:19:42Z","title":"QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T17:18:41.284513Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2607.04559"},"observation_digest":"sha256:0443a04e31a5d082bdfebe4b8ca01b0a0427b832ebea9978e6dfb6ebe56ccfb4","observation_id":"d17f9179-1967-46e3-a4f5-ef6e5753af6e","resolution":{"observed_at":"2026-07-11T17:18:41.284513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-01T08:49:13.405920Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21013","last_updated":"2026-07-25T07:42:56Z","snapshot_observed_at":"2026-08-13T20:22:13.125382Z","submitted_at":"2026-07-23T07:52:40Z","title":"EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T08:49:13.405920Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2607.21013"},"observation_digest":"sha256:298a88dbd72c50ecf4b67c25366e61bd8444ff67da1f92667b950e1b2b9adf28","observation_id":"ea0d2259-c377-4a65-9e2d-3c4fe634035e","resolution":{"observed_at":"2026-08-01T08:49:13.405920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-14T04:28:26.603246Z","title":"Nvila: Efficient frontier visual language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08815","last_updated":"2026-08-09T17:05:00Z","snapshot_observed_at":"2026-08-14T04:21:04.595493Z","submitted_at":"2026-08-09T17:05:00Z","title":"Distilling Vision-Language Models for Robust Traffic Sign Perception in Autonomous Vehicles","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:28:26.603246Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2608.08815"},"observation_digest":"sha256:6306eda0d4d5fcb2cc5b49aa09102183b16fe9a825d17c49b72ef9ca6db39989","observation_id":"db80bc62-7e7f-4b6a-b90a-06ce968b1f47","resolution":{"observed_at":"2026-08-14T04:28:26.603246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04468/citation-record","integrity":"/paper/2412.04468/integrity","json":"/paper/2412.04468/citation-record.json","paper":"/paper/2412.04468"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Instruction Tuning","venue":null,"work_id":"00017918-32c5-4537-85e5-b3e4317ae475","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:afdb5c551e52821f525b245966f1ab534ffe5f71ed4f6b5ac103b4b274f17b56","observation_id":"c658f817-5680-4c89-9a34-5300500b094f","resolution":{"observed_at":"2026-05-23T07:42:44.961908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VILA: On Pre- training for Visual Language Models","venue":null,"work_id":"c928cd30-c1e0-4fb3-a657-54903774965b","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:6e5cf039cb0ddf7769c2b954286fd9848fceeda391ae7b6665311adadd1a6a4d","observation_id":"7e402fbf-49ce-4bb6-bc8d-d1fa3b554776","resolution":{"observed_at":"2026-05-23T07:42:45.138115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InternVL: Scal- ing up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","venue":null,"work_id":"284eefd9-f441-4031-a616-373ffd4cf0e8","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:d16aa8f757c07ea6a6742f70f8b68d3e6c1e7726e55f338d4eec02fdf646e193","observation_id":"21618f3b-b038-47eb-bf36-c96871706eaf","resolution":{"observed_at":"2026-05-23T07:42:45.149747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:77cbd5ac7236422ee6ef695ef70f4858719779a997db48b278433921f0634289","observation_id":"de0a1d31-fe8c-4354-aea6-046e16d7fbde","resolution":{"observed_at":"2026-05-23T07:42:43.116592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:1c36a6c69a6ba7998e4a6977387ad57499fad36be51ccee74127d4f3320729db","observation_id":"eb365286-d69a-4951-ae58-926ac93b665f","resolution":{"observed_at":"2026-05-23T07:42:43.034094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":null,"work_id":"651ed3ea-3ed4-4624-bd06-0932b6211cbe","year":2022},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:6f4c9c46f475abea9407ddb5b8d8fd05f3ab725324d5c659fa3cdf7d309242c2","observation_id":"d9835b24-3200-4f31-b79c-68f7dd2c26a0","resolution":{"observed_at":"2026-05-23T07:42:45.179860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NaVid: Video- based VLM Plans the Next Step for Vision-and- Language Navigation","venue":null,"work_id":"f7d7c888-d674-4a76-ac62-9760fa8df719","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:ca8c37532c0383bb82fef61eceffb07fda1accf1c548e9a1990daed151b66185","observation_id":"07340e2c-05a6-4030-b44a-9a3512e88a75","resolution":{"observed_at":"2026-05-23T07:42:45.183731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-11T21:21:36.601778Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:a7d1805f613f586774c43e943a2f9d160c2e51d1dad6ff4deaffcd5ea2449cd2","observation_id":"fac3d417-f91f-4a1e-a41c-8d39f05ae5cc","resolution":{"observed_at":"2026-05-23T07:42:43.167538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DriveVLM: The Con- vergence of Autonomous Driving and Large Vision- Language Models","venue":null,"work_id":"417a5d1d-52da-4ca8-8dd8-807aba0635b2","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:68621a74c9dccea0a59a64782709539fa6a4dc377bac12f9dd39a86dadc3c675","observation_id":"2c051837-21f5-4308-9aa1-12d9722b9c3e","resolution":{"observed_at":"2026-05-23T07:42:45.164564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18416","last_updated":"2024-05-01T17:12:10Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T04:11:28Z","title":"Capabilities of Gemini Models in Medicine","version":2},"cited_work":{"arxiv_id":"2404.18416","doi":"10.48550/arxiv.2404.18416","metadata_source":"pith","pith_arxiv_id":"2404.18416","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Capabilities of Gemini Models in Medicine","venue":"cs.AI","work_id":"27822395-fb36-4417-a4f3-f0a1f801ac20","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2404.18416","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:796c7c2bebea59344a820ec1ff47d45d0c2c01f3973bef3fc8556fa20630ff3c","observation_id":"065bccfa-ae10-4737-8662-e41571af98e6","resolution":{"observed_at":"2026-05-23T07:42:43.173481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12915","last_updated":"2025-03-04T18:51:48Z","snapshot_observed_at":"2026-08-12T23:46:13.611739Z","submitted_at":"2024-11-19T22:59:14Z","title":"VILA-M3: Enhancing Vision-Language Models with Medical Expert Knowledge","version":3},"cited_work":{"arxiv_id":"2411.12915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.12915","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VILA-M3: Enhancing Vision- Language Models with Medical Expert Knowledge","venue":null,"work_id":"1ac8a71a-e3d9-411e-9a50-815d49097fbd","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2411.12915","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:1e4d9b3fddc272b1c15f443f246865047e1668204a1a06f717e036fd6aa14bcb","observation_id":"de87e671-2e4d-4750-a93a-b575a91f387c","resolution":{"observed_at":"2026-05-23T07:42:43.097491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT-4o","venue":null,"work_id":"8a5a9555-2808-4d65-ab95-80bc7b078fe5","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:2879b9b5a3a1480229cddeaf233632fbe6c4d88c6f4c685eaf92d6cc208d94f1","observation_id":"f0305393-6f15-4e35-9c92-1e8b21d1ea90","resolution":{"observed_at":"2026-05-23T07:42:44.998704Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3.5","venue":null,"work_id":"c8d9f3b1-cc7d-40c8-aeac-d3640d7c09f8","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:8778873bde960011bfea9d1f95084a3ffe61e089eca5d82cd296e043ddbdbec3","observation_id":"f436c905-dcd4-44ca-a083-c9d1fc291fdf","resolution":{"observed_at":"2026-05-23T07:42:45.002617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid Loss for Language Image Pre-Training","venue":null,"work_id":"12c13528-f93f-4fe9-8679-230380789143","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:44d83d98a4fed6379a22860331dc746e825c5a6017c0dd7b03bed307d180ef1a","observation_id":"0e945f66-600a-4f9c-ab60-a6e9bf05e738","resolution":{"observed_at":"2026-05-23T07:42:45.006550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:96b7c2f942aab4b0b7f4daa54f2603485c9251f0811b08e6cdae818f286016a4","observation_id":"e93f96ae-481e-4e62-a3b8-71c89280d9a2","resolution":{"observed_at":"2026-05-23T07:42:42.974053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When Do We Not Need Larger Vision Models? InEuropean Conference on Com- puter Vision (ECCV)","venue":null,"work_id":"ee4e0de5-c972-4160-9f5d-995f4240996b","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:5199df36b51acc4643b4f4e49222b4a3e097b91bdba43e57cc293efa35d8a61a","observation_id":"72e248a8-940f-4bcb-a4a7-fa82bbfa9974","resolution":{"observed_at":"2026-05-23T07:42:45.021123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":"2404.16821","doi":"10.48550/arxiv.2404.16821","metadata_source":"pith","pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","venue":"cs.CV","work_id":"3714835e-c5a6-4d7e-950c-be44670ed9e6","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:f3642dd793a994544fad7f99be13500add42aafde812c7d9bed7eeac5014b16c","observation_id":"dfc1914d-df12-4c14-8922-a08385485d80","resolution":{"observed_at":"2026-05-23T07:42:43.204294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:1d1cd6735e98dd07123f22f24064c0e6ed65f5d6396c12e539267c883ca8c1a4","observation_id":"c392ca64-216d-42c5-92cc-b81534e786c0","resolution":{"observed_at":"2026-05-23T07:42:43.085376Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:625b877d91d66a84fe447305c47f555a77fedd4cb325383a31f082731387ea96","observation_id":"ea14d6be-01bf-48f9-b97d-92803853f4b6","resolution":{"observed_at":"2026-05-23T07:42:43.247372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tem- poral Segment Networks: Towards Good Practices for Deep Action Recognition","venue":null,"work_id":"b019cd67-f42a-4995-9d1f-e9ed5ace5889","year":2016},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:401554299ff799bf155d9507883e1eecfd9fda24c3e0eef2275b90e98f9d8abc","observation_id":"a7ac950e-dd95-4f91-bdc0-6b0feafac78c","resolution":{"observed_at":"2026-05-23T07:42:44.949356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambrian-1: A Fully Open, Vision- Centric Exploration of Multimodal LLMs","venue":null,"work_id":"ae301a43-11fb-47ff-abc6-bf2c1b7edbf8","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:7adacfaa2fd7d752fceea6a31213d9ce9de8e6cc3e80af01408bc6e689f8ba0e","observation_id":"838def6e-7b0d-40da-a2fb-3d8bc4eaccd3","resolution":{"observed_at":"2026-05-23T07:42:44.945210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What Matters When Building Vision-Language Models? In Conference on Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":"b491458d-5520-43cb-88cf-db9b8533d640","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:50d0b3d2bd912cdc9ab5fa9f4bae82355301f4f6e5e31d8ef8ceac64c2c98001","observation_id":"cf2cddb9-dd6a-4ef2-b297-79d621f7bdb9","resolution":{"observed_at":"2026-05-23T07:42:44.953902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Selec- tion via Proxy: Efficient Data Selection for Deep Learning","venue":null,"work_id":"03f2f9dd-a398-4ea4-8d9a-01d303b4ea02","year":2020},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:b0a5ed39db375fb235f8f2224b6d33da3865a872630601ea08fea62f85479043","observation_id":"f5600f71-53cf-473b-b204-887322d50fef","resolution":{"observed_at":"2026-05-23T07:42:44.982503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Demystifying CLIP Data","venue":null,"work_id":"dd56dd06-c7d8-4c05-817c-345c020060d8","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:9111beda670bb28b720e5bdb2bd5acd4b2c5314d06208368fe5b7587651c3bc8","observation_id":"1163e972-deef-40b9-9123-c9e0e6067e82","resolution":{"observed_at":"2026-05-23T07:42:44.937555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:72102be737845f1c40b84c60e6a06b0001033f6b2a3d0e459f6b41d12fba5e91","observation_id":"0e70f842-e46f-40ce-ba63-ef807efa0db2","resolution":{"observed_at":"2026-05-23T07:42:43.028054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D4: Improving LLM Pretraining via Document De-Duplication and Diversification","venue":null,"work_id":"b8f74d39-bb4e-4d7a-b62f-4305322cd064","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:a16e72d330722739fcaaee5330b03164bba03f9f11c6b7f15826dfa243d3c7c8","observation_id":"844471cb-a865-48c8-8d4b-d4904b48406a","resolution":{"observed_at":"2026-05-23T07:42:44.933854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LESS: Select- ing Influential Data for Targeted Instruction Tuning","venue":null,"work_id":"e5348a0b-dd52-4d91-b94f-29d73833c019","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:4988c5d860591797ca6418c5ab44acf581e018c1d801802d2fb355546f88e48d","observation_id":"5d6076ce-9d5b-442e-af8a-cd03b61d2312","resolution":{"observed_at":"2026-05-23T07:42:44.929763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07064","last_updated":"2025-03-18T23:52:27Z","snapshot_observed_at":"2026-08-12T22:27:02.729999Z","submitted_at":"2024-10-09T17:06:57Z","title":"Data Selection via Optimal Control for Language Models","version":2},"cited_work":{"arxiv_id":"2410.07064","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07064","snapshot_observed_at":"2026-06-28T22:32:44.639684Z","title":"Data Selection via Optimal Control for Language Models","venue":null,"work_id":"04080f89-016b-40d0-8185-cc7645c641ae","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2410.07064","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:893e7281376a54eed20408cf578f8405cedf3758c493b49da4becc27baa9bf70","observation_id":"95b2051f-5b18-4279-8f96-93f0b70a0724","resolution":{"observed_at":"2026-05-23T07:42:43.067445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17215","last_updated":"2025-03-19T00:03:30Z","snapshot_observed_at":"2026-08-12T23:17:55.025994Z","submitted_at":"2024-10-22T17:40:32Z","title":"MiniPLM: Knowledge Distillation for Pre-Training Language Models","version":3},"cited_work":{"arxiv_id":"2410.17215","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.17215","snapshot_observed_at":"2026-07-07T12:33:45.182803Z","title":"MiniPLM: Knowl- edge Distillation for Pre-Training Language Models","venue":"cs.CL","work_id":"70937be9-06f4-4a65-a07c-a01e4c4096ab","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2410.17215","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:ed2d8fd8a16f39d98df508bda31742a676a5069a701dd3a8022f54455692ce14","observation_id":"3ec15776-1f00-489e-bcf4-bdb56a9bca33","resolution":{"observed_at":"2026-05-23T07:42:43.229445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:ac02a5fee614a44fe24babac27b53623c8dee2632cb7a1eabf17b17ab1db4b13","observation_id":"b688c074-fbc0-45fe-a1fa-7b85d8d9a822","resolution":{"observed_at":"2026-05-23T07:42:43.122814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixed Precision Training","venue":null,"work_id":"84ffe8ed-c533-4e02-80a4-ff4886ca55a2","year":2018},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:cb4246cb3413e71bae2a0736cfaab2ad479bc953384a84425077f9f4ad1471c1","observation_id":"81739734-a2c9-4894-82f2-ef951d1da7b5","resolution":{"observed_at":"2026-05-23T07:42:44.990057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12322","last_updated":"2019-06-13T17:55:30Z","snapshot_observed_at":"2026-08-04T04:17:53.148033Z","submitted_at":"2019-05-29T10:50:32Z","title":"A Study of BFLOAT16 for Deep Learning Training","version":3},"cited_work":{"arxiv_id":"1905.12322","doi":"10.48550/arxiv.1905.12322","metadata_source":"pith","pith_arxiv_id":"1905.12322","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Study of BFLOAT16 for Deep Learning Training","venue":"cs.LG","work_id":"5e0bebf8-8f7b-4b5d-afd7-8867758a6277","year":2019},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/1905.12322","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:4c9b8c266f6b887cb48bd2c8bbf498c9cd0047ef61b58ccff8a067ef2626124e","observation_id":"50250526-4ebc-48ec-b0e4-66fe55ab60a8","resolution":{"observed_at":"2026-05-23T07:42:43.241273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18313","last_updated":"2023-12-19T12:27:58Z","snapshot_observed_at":"2026-08-14T02:07:23.162064Z","submitted_at":"2023-10-27T17:59:51Z","title":"FP8-LM: Training FP8 Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.18313","doi":"10.48550/arxiv.2310.18313","metadata_source":"pith","pith_arxiv_id":"2310.18313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FP8-LM: Training FP8 Large Language Models","venue":"cs.LG","work_id":"8aa8a89a-8428-4ed6-9efe-c9d583f852cf","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2310.18313","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:83865d66869653678857d00e7769b8ab16522ffd6c64262660ce49074134ea49","observation_id":"763e5068-7994-42db-ac48-6d78988c0002","resolution":{"observed_at":"2026-05-23T07:42:43.015165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:31.760018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:31.760018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19313","last_updated":"2025-02-12T23:37:50Z","snapshot_observed_at":"2026-08-12T22:15:22.324550Z","submitted_at":"2024-10-25T05:59:30Z","title":"COAT: Compressing Optimizer states and Activation for Memory-Efficient FP8 Training","version":3},"cited_work":{"arxiv_id":"2410.19313","doi":"10.48550/arxiv.2410.19313","metadata_source":"pith","pith_arxiv_id":"2410.19313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"COAT: Compressing Optimizer States and Activation for Memory-Efficient FP8 Training","venue":"cs.LG","work_id":"6c512b3e-ec3b-4af1-bfc1-b0ec4eb0c860","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2410.19313","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:f861d567ec0b81b7c6dc87a65df26d692f9fe96a16268324870db92bc5fa5e56","observation_id":"8115b9a9-7792-413d-b96d-27780fc30645","resolution":{"observed_at":"2026-05-23T07:42:43.059995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:31.986644+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:31.986644+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10989","last_updated":"2025-01-24T00:14:55Z","snapshot_observed_at":"2026-08-12T22:23:22.667861Z","submitted_at":"2024-10-14T18:17:01Z","title":"Liger Kernel: Efficient Triton Kernels for LLM Training","version":3},"cited_work":{"arxiv_id":"2410.10989","doi":"10.48550/arxiv.2410.10989","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10989","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liger Kernel: Efficient Triton Kernels for","venue":"arXiv (Cornell University)","work_id":"ce624c61-a8db-44ff-9646-e09326d1328e","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2410.10989","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:5582b56fa43c398f361970a847f9ef198af7b622e0d53be6f476b5ec6549af3b","observation_id":"3a9ec0b3-8fb2-4a21-9f76-98ed7625c5df","resolution":{"observed_at":"2026-05-23T07:42:43.002506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T05:54:39.54334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T05:54:39.54334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Android in the Zoo: Chain-of-Action-Thought for GUI Agents","venue":null,"work_id":"2c0bcb06-6554-490e-a456-ee86e1b20349","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:6695a9b5d968eb9293b6be6cfbdbe3ce99140fa90f83a035fa1e1063f475008d","observation_id":"6399bd8d-8383-441f-8e6a-2203a2c28312","resolution":{"observed_at":"2026-05-23T07:42:44.906025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ALFRED: A 14 NVILA: Efficient Frontier Visual Language Models Benchmark for Interpreting Grounded Instructions for Everyday Tasks","venue":null,"work_id":"6f1117e8-c58c-430d-94cc-7f83fbfc9f07","year":2020},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:6c81ffc7946f8eb72f86da6e557bf6f9ce0c94929e7d7ddf2d21497bc711921c","observation_id":"2829ea84-aa87-4322-a0bc-44a063cfa7c9","resolution":{"observed_at":"2026-05-23T07:42:44.911213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"nuScenes: A multimodal dataset for au- tonomous driving","venue":null,"work_id":"c13fc374-e094-4b33-840b-893a461e8493","year":2020},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:316495ee2c018f24e40c05904631f848b3ab26cd70347878b7b1611f941b646f","observation_id":"94f0944f-bc99-40b0-aa59-d3f6a4581304","resolution":{"observed_at":"2026-05-23T07:42:44.915070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":"2003.10286","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-07-10T18:57:31.568292Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","venue":"cs.CL","work_id":"4e35c15f-5a72-4a89-a773-9d4036871506","year":2020},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:5d79f13f1b3a24be7a5ccf5999404ab94144808de859ead70abc74b25662087a","observation_id":"c3b1dec3-33db-45ab-9e43-2308ea293ca0","resolution":{"observed_at":"2026-05-23T07:42:43.185714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Widget Captioning: Generat- ing Natural Language Description for Mobile User Interface Elements","venue":null,"work_id":"4a3460b9-eaaf-4161-9c14-79332e65fa9d","year":2020},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:faa575751316c6f190a6652aa7cdf68c2177d667a6fb901a4bead50a16aa8fa4","observation_id":"9599a630-956d-4f7c-96e2-5c193a50c1c5","resolution":{"observed_at":"2026-05-23T07:42:44.974323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AWQ: Activation-Aware Weight Quantization for On-Device LLM Compression and Acceleration","venue":null,"work_id":"2299012a-ec9c-4332-8650-e393bc6cdc61","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:4b3a893a3daa1e13512d1ee20b65ed06b0561c6a77687e99e4ffdf15f18c2e72","observation_id":"df564449-1736-41d3-b567-f5585c43199e","resolution":{"observed_at":"2026-05-23T07:42:44.965633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learn- ing Library","venue":null,"work_id":"f7551e21-499b-4773-bc23-b437f13d97a4","year":2019},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:a9e06fa52d665eaed2044981d5f5496e4113375f90c8333c0f7b33cef9efbed2","observation_id":"4e818683-0073-4a39-bf6f-04a812287ba4","resolution":{"observed_at":"2026-05-23T07:42:44.978357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e58fb7cb-2b52-417e-b9dd-398e245ba46b","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:715d54a9f07e01ee515c7a0855b923500285a7ead1ee989b91535a0f229c4fd5","observation_id":"362f27c4-387b-4acc-8d88-8844a1090d22","resolution":{"observed_at":"2026-05-23T07:42:44.878933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transform- ers: State-of-the-Art Natural Language Processing","venue":null,"work_id":"b6148c2d-eb8a-47a7-b696-934ca7ad33ce","year":2020},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:c85df7ff73b2ed7168497bef0e009c1d3631a91c264f386df1c87760a2825389","observation_id":"7299f300-cadb-42a6-b99d-47f60602afe6","resolution":{"observed_at":"2026-05-23T07:42:44.969823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSpeed: System Optimiza- tions Enable Training Deep Learning Models with Over 100 Billion Parameters","venue":null,"work_id":"079d5a11-5ad8-484c-a3e0-52e0a1cd9940","year":2020},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:5ed550a96445ee11e3815ad8e66bd6b195d888f637b7f3a7671b591abd957c6c","observation_id":"bdf9982e-289a-404b-86f0-a773dde55f94","resolution":{"observed_at":"2026-05-23T07:42:44.882790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":null,"work_id":"79f91df6-0a90-4db9-87fd-233b5cb8b328","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:33600df6d21016bdfdd3f7a123e3e1c65449bc476375d4233501982a969f618b","observation_id":"ebea230e-88ce-43fa-b5ef-82970b2c7fd7","resolution":{"observed_at":"2026-05-23T07:42:44.865826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Diagram is Worth a Dozen Images","venue":null,"work_id":"516a50e0-5ac4-447b-8400-34adc2183b8d","year":2016},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:f6c207e085ef0b44bd8df7eee0e9278040027084516567c9dee9c84d726e4eb1","observation_id":"1699b915-1da3-4822-af0a-c2cb67256e73","resolution":{"observed_at":"2026-05-23T07:42:44.862305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":null,"work_id":"1fd97b47-654a-4607-9f17-fae525013de0","year":2022},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:ba33772e43ba819332c648403deaea1f6f7d377f86b77a1c7ecbbb2a634da39a","observation_id":"4e981fcc-98c0-4420-8116-b1b00f50cd7a","resolution":{"observed_at":"2026-05-23T07:42:44.871799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DocVQA: A Dataset for VQA on Document Images","venue":null,"work_id":"ae76c5b9-19c3-4565-b333-10e7d259c83a","year":2021},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:096f6e5b38ef48c11e0403a5b831d48d7dc7b137b01e4445826fe0f3b1f8785c","observation_id":"665a079b-3d1f-4a86-bddc-bad24504bb99","resolution":{"observed_at":"2026-05-23T07:42:44.875552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InfographicVQA","venue":null,"work_id":"a6784d50-6734-4eef-800a-9d1585f28050","year":2022},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:c2222f6eeb3a85c535ea664ab3dafc2574921d1ecde1a4aa492776d5babb1163","observation_id":"1025ed41-a7cd-4606-a99f-fcf192a0416c","resolution":{"observed_at":"2026-05-23T07:42:44.888114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":null,"work_id":"6114bec4-a9ae-431b-86d2-e83826ceb9d6","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:74e0f33d43b7c874fd5b18bea84ad7dfedccafff9c9930e85d156218b9cffeb1","observation_id":"23ecab5f-374f-4d4e-9d6f-7f423bb37078","resolution":{"observed_at":"2026-05-23T07:42:44.891994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Ex- pert AGI","venue":null,"work_id":"edc4fbe4-c874-4e57-83c6-51d85f757154","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:1724c80043df6e1369fcabe388987fe8565079f6074d9595bd4a205b6ea65f61","observation_id":"e89a03d8-0081-4be5-a23f-568cb384996c","resolution":{"observed_at":"2026-05-23T07:42:44.986285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grok-1.5","venue":null,"work_id":"c2b10170-06c6-4183-95d0-0ba1d4940b85","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:2464a42fffebce13b55b9c97423783783412dd8dd1480bbdc946d946f09ac23e","observation_id":"888533a0-943d-4b67-a934-79718fc8fb21","resolution":{"observed_at":"2026-05-23T07:42:44.841228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SEED-Bench: Bench- marking Multimodal LLMs with Generative Com- prehension","venue":null,"work_id":"9e08d024-e644-4644-9781-ab775cd048b0","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:768510e96192d47db8e1beb8886294e784596a5d842b67cb19c0926250e05c99","observation_id":"c3d8f52c-a31e-422b-92a7-40587bf421ca","resolution":{"observed_at":"2026-05-23T07:42:44.800633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards VQA Models That Can Read","venue":null,"work_id":"ba93b0df-669b-4eb6-b180-c15ebc40fc86","year":2019},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:816be587ce949ea959220cd862fb7f0cb5780bde814d01d452f128e160535cad","observation_id":"c3c9bccb-336b-44eb-b7ab-d0bfee4ba589","resolution":{"observed_at":"2026-05-23T07:42:44.792688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the V in VQA Matter: Elevating the Role of Image Un- derstanding in Visual Question Answering","venue":null,"work_id":"ba03440d-b69c-40c6-8647-e69dc6c70449","year":2017},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:8ac0211b041fd5004c08babb48277c9d1b100f7294198e133bd45ede279dbc95","observation_id":"df3b8aaf-47a1-4696-bf74-5d56706a41d0","resolution":{"observed_at":"2026-05-23T07:42:44.786539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question Answering","venue":null,"work_id":"c4b8d3be-3663-43eb-bfa0-23f9ff8d83f3","year":2019},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:32c659319f66bd9630788d6a9f23fd5447c230c65bd8493aab78bcf8f9a36012","observation_id":"a5d6d94b-0c36-40cd-b6ad-05d9f632e7d8","resolution":{"observed_at":"2026-05-23T07:42:44.796813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":"2406.04264","doi":"10.48550/arxiv.2406.04264","metadata_source":"pith","pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","venue":"cs.CV","work_id":"346256da-dd21-4cc3-9a98-519467614854","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:61f29a89a7e6fba152d599e2367cbf493b24f017d5ed9c685702e156bb360310","observation_id":"6d4e6973-97bc-4567-a4d3-cfd190ff6f8f","resolution":{"observed_at":"2026-05-23T07:42:43.079511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","venue":null,"work_id":"593c75e6-c2ce-45bc-9225-4972c6021c6a","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:c965506166318dbd625e37f3ce7aad4f318677379085c8739c5ad4a95bc00294","observation_id":"055794bc-c8ac-499c-8a8b-b2327ebca634","resolution":{"observed_at":"2026-05-23T07:42:44.845079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:ed11b23639e85fc522146e1380c6c2f6f6667208cf8c5af896039502b48c672d","observation_id":"6c74f650-7f1a-489a-9a26-33bb88593b47","resolution":{"observed_at":"2026-05-23T07:42:43.253957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-08-12T22:40:07.009932Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:71aa89472d865e2cedb7d205b1d4ac4d9a28074d8d44b11bc643422bab15fa7a","observation_id":"1cf91e4a-058b-46e0-825a-d4ae68ca3742","resolution":{"observed_at":"2026-05-23T07:42:42.987016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-08-13T11:36:11.821356Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":"2410.17434","doi":"10.48550/arxiv.2410.17434","metadata_source":"pith","pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","venue":"cs.CV","work_id":"82f3cbed-22bb-41b5-b9c9-67304154cd52","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:08f08ef22c3ea43528f7f16dfc37d3cb475c0480b1326766e65e7742d8fb6b7b","observation_id":"e033c718-bf9c-44dd-9d21-9a460348fedc","resolution":{"observed_at":"2026-05-23T07:42:43.110273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-12T22:41:32.229292Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":"2409.12961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-07-04T13:09:50.847114Z","title":"Oryx mllm: On- demand spatial-temporal understanding at arbitrary resolution","venue":null,"work_id":"4a905ca2-7426-40db-a509-3452624d3ae5","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:55672742241254a2479d18d95ea4215947e07ccb2feaabc9ab80bc7ade7dbd4d","observation_id":"e0925f8d-efec-4110-8251-c6b1daa0f532","resolution":{"observed_at":"2026-05-23T07:42:43.235839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":null,"work_id":"34b4a87b-286c-4cfd-861c-8ef351826c23","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:d784457ca39d2e481d63900252b23668f6b6cba374d62434ba4882c62f4e315d","observation_id":"edab20d8-b0ce-4df3-a0ff-1c2ad6558c6e","resolution":{"observed_at":"2026-05-23T07:42:45.191341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the Nav- Graph: Vision-and-Language Navigation in Con- tinuous Environments","venue":null,"work_id":"85dd2bd6-00e7-42b9-8a13-6ecb1731f7aa","year":2020},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:a0ac7cea6b1e30b598088c9631c8481dce904e45b9e3d701c1d30ba4bc10b682","observation_id":"c5ee4a49-5d12-45af-8124-3dee8cec76f9","resolution":{"observed_at":"2026-05-23T07:42:45.171916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision- and-Language Navigation: Interpreting visually- grounded navigation instructions in real environ- ments","venue":null,"work_id":"562b85ee-f7d1-4787-ad9a-02980bc6c1aa","year":2018},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:63902814e310072b5ea0991b4241d1cc300e648675ca84a2d876c919716e86de","observation_id":"89292ad6-ecc1-4c16-a690-03ea6392567f","resolution":{"observed_at":"2026-05-23T07:42:45.175899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT-4V","venue":null,"work_id":"9de8bdbf-9708-4d4c-8b5d-99997aaab926","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:698b75872d5ca2ca639c96d2c7a9f7cf08383be64b2180ca1d099af2e4d6587e","observation_id":"77b1c0f1-b55b-4e80-977e-0c679e5b3e33","resolution":{"observed_at":"2026-05-23T07:42:45.160700Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:97c57859c1c26312e1e23649e75b14095f1da00f0bcf7b681654b0a67f641d82","observation_id":"da30d0df-3a48-4caa-b0c8-7788deffc3d8","resolution":{"observed_at":"2026-05-23T07:42:43.216467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:42e7052a5989c2aa07c98bb02bc6175a79da8376d49ef4774ca631a262c42d08","observation_id":"edd9bf7d-9161-4a80-b075-6286672d5cb8","resolution":{"observed_at":"2026-05-23T07:42:43.198281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3","venue":null,"work_id":"9578f2a0-d85a-4c0b-b6e6-d2c9f81c0cd0","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:332b11283a8d4f63d06288cff1b5b6001a12e771ba5f9998b6dd397cfc12b387","observation_id":"ddb48495-72ea-4dd7-a51c-653c855f8292","resolution":{"observed_at":"2026-05-23T07:42:45.157283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-14T09:55:01.826879Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":"2409.20566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-Tuning","venue":null,"work_id":"7086f9fa-2338-45a8-812a-3e6f7b64cc50","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:d77ac9d38604876e8282ea47ce8cbd21e6e06d374d700cd676722a504a895e09","observation_id":"7685e922-b9cd-486f-8d3f-53beeaf886d3","resolution":{"observed_at":"2026-05-23T07:42:43.073686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.09577","last_updated":"2019-09-14T03:51:46Z","snapshot_observed_at":"2026-08-03T18:17:55.398298Z","submitted_at":"2019-09-14T03:51:46Z","title":"NeMo: a toolkit for building AI applications using Neural Modules","version":1},"cited_work":{"arxiv_id":"1909.09577","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.09577","snapshot_observed_at":"2026-07-08T17:15:09.332377Z","title":"arXiv preprint arXiv:1909.09577 , year=","venue":"cs.LG","work_id":"8025af67-043c-453f-b000-17014649401b","year":2019},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/1909.09577","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:8a0c44e36f545a67b121b71f95b594745326c82c61b2d73bc6ea73ddd79193f3","observation_id":"1c284017-9be1-4db1-aa96-a17c583a5a8c","resolution":{"observed_at":"2026-05-23T07:42:43.155511Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17453","last_updated":"2024-10-31T23:23:22Z","snapshot_observed_at":"2026-08-12T23:15:28.135270Z","submitted_at":"2024-07-24T17:37:05Z","title":"VILA$^2$: VILA Augmented VILA","version":2},"cited_work":{"arxiv_id":"2407.17453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.17453","snapshot_observed_at":"2026-07-02T11:46:55.437498Z","title":"VILA2: VILA Augmented VILA","venue":null,"work_id":"cda20748-41d3-4441-bd08-7b1038d3a0c0","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2407.17453","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:264492f7517f19cd67544af91d4dbeb211a95c698cfd0922f881b89605c5a876","observation_id":"7dfa2d0c-36c5-40a7-8f07-00a77ad85d95","resolution":{"observed_at":"2026-05-23T07:42:43.222941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-12T22:55:41.155703Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":"2408.15998","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-07-04T15:09:55.297801Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","venue":null,"work_id":"0fbfe096-026b-4d72-a17c-0d68727084ff","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:9ae7e5627e17aa9147cc8442f932fbe8b52669127addde89d3ab7fbca68c014c","observation_id":"16dc2d83-7125-423b-8fce-4acc5191ded3","resolution":{"observed_at":"2026-05-23T07:42:43.210588Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-12T22:43:01.323456Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2409.11402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-07-02T02:56:29.429018Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","venue":null,"work_id":"05897a70-23cd-425f-b903-02c1293c04a0","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:359a93af50f3e4861ebc08e2a80021d20f40510c70d552afdd6ce42b55fbc252","observation_id":"472ca8b3-5aa7-484a-9f42-e3db9cad979b","resolution":{"observed_at":"2026-05-23T07:42:42.980731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama 3","venue":null,"work_id":"30825bdb-9a73-4235-9cdc-ec3194e94819","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:90aa1b38d4e9d4f7aaa1a78aabbc160db535b687bba715f51b3fda477ec7d55f","observation_id":"aae3c11c-6695-43ab-8603-a73b3decfd54","resolution":{"observed_at":"2026-05-23T07:42:45.130109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token Merging: Your ViT But Faster","venue":null,"work_id":"9568d506-40b2-4838-910c-40f3c726a2c5","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:0b5fda42dfa0d1b1105e47e0a3919fea7ce056da2a7057afc01cfc3d674cbd00","observation_id":"be39da09-02f6-4bf7-8458-0dd31891e10a","resolution":{"observed_at":"2026-05-23T07:42:45.122333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug- and-Play Inference Acceleration for Large Vision- Language Models","venue":null,"work_id":"6d784176-8638-43b7-ac97-f569d8642770","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:75c737d9adfbb2d3a3666e12dfdf52622040e2cd6b3b56d72a33d1688bcf1ffd","observation_id":"a25880f7-17e2-4985-8864-df67bdb5350b","resolution":{"observed_at":"2026-05-23T07:42:45.126198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PYRA: Parallel Yielding Re-Activation for Training-Inference Effi- cient Task Adaptation","venue":null,"work_id":"bb885c8e-1d56-41ef-b190-b9366e639780","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:c60e7be52ec0490945ce10079a0102166bbdb99eca163111c0c790bc9886d9d2","observation_id":"1609cef4-edcb-4880-a0b6-619850ec017e","resolution":{"observed_at":"2026-05-23T07:42:45.134265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"vid-TLDR: Train- ing Free Token Merging for Light-Weight Video Transformer","venue":null,"work_id":"d166a2f5-8431-458d-84ce-61fe7be4b37d","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:29f96f8a6e3dd5cef60d52d9a53c7aa5c0bebce99a04d35fb1dd54deb10ee42b","observation_id":"ad59abf5-8b18-4838-b771-f17481662b7a","resolution":{"observed_at":"2026-05-23T07:42:45.142009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding","venue":null,"work_id":"a4cda0ab-02ca-4beb-95fb-e4a9240390f8","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:cbc26a02b6e70cd369a5e378b50b088aab672ba82e43a1ac0e917ca7be0372a3","observation_id":"e21b41aa-b298-44f2-ad26-40da19a210df","resolution":{"observed_at":"2026-05-23T07:42:45.145747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-13T07:57:16.456717Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:ed6752fff4ac70b6d88ae9442c785ca4c50fa112361ac14ac2da08dad1238c07","observation_id":"1574aa84-21a1-442e-9207-b8afb5df4826","resolution":{"observed_at":"2026-05-23T07:42:43.161469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SpatialRGPT: Grounded Spatial Reason- ing in Vision Language Models","venue":null,"work_id":"a39f6656-487a-4182-876d-674154590521","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:fd93bab4bc0f95c274db355290af6e04f8be4f0761ff12eb10ec7597d397a850","observation_id":"6760d202-3531-4459-8452-31a5f500b91b","resolution":{"observed_at":"2026-05-23T07:42:45.113656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DoReMi: Op- timizing Data Mixtures Speeds Up Language Model Pretraining","venue":null,"work_id":"174c8e65-c6e2-4f88-93df-423fbdaaae95","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:5d541ce385495fd7fc4c3a4429b6e61d505afe1520df2592b72d6ceec53d7dbc","observation_id":"e77fef2b-922b-4ab1-8c30-6d2ed0685a44","resolution":{"observed_at":"2026-05-23T07:42:45.109875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15653","last_updated":"2023-11-27T09:33:13Z","snapshot_observed_at":"2026-08-13T05:17:14.338733Z","submitted_at":"2023-11-27T09:33:13Z","title":"MoDS: Model-oriented Data Selection for Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2311.15653","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.15653","snapshot_observed_at":"2026-07-03T04:07:36.851193Z","title":"MoDS: Model-Oriented Data Selection for Instruc- tion Tuning","venue":null,"work_id":"bc5df1c5-b91f-4fa1-a315-fb563f35a649","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2311.15653","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:ce3dfbb618da938906ab2bc6777a8f7abb79fca2a85dda8a8231b4d3f9937159","observation_id":"976e3530-1f39-4120-b463-541ccb795faf","resolution":{"observed_at":"2026-05-23T07:42:43.091735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-12T22:41:57.708643Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":"2409.12517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-07-03T07:27:44.431731Z","title":"Scaling FP8 Training to Trillion- Token LLMs","venue":null,"work_id":"67213178-57f3-4231-9e3e-3545902d31de","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:cd3d4c3eee187d33531c2992fefa7f32b10176a5f90f5d91b6ba43c3d1363985","observation_id":"c4b9be6e-0317-4925-8dc5-709c656c726e","resolution":{"observed_at":"2026-05-23T07:42:43.040130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-08-14T05:39:52.416140Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":"2209.05433","doi":"10.48550/arxiv.2209.05433","metadata_source":"pith","pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FP8 Formats for Deep Learning","venue":"cs.LG","work_id":"c7217bc9-e53d-40c5-a437-25a74abc36cd","year":2022},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:304fd202d233526c5c99a848a25fa1bf82d785a13c6325b63edac04886077508","observation_id":"14c8b524-7342-4caa-a142-b1975c554440","resolution":{"observed_at":"2026-05-23T07:42:43.142391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:35.618396+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:35.618396+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Com- pact Language Models via Pruning and Knowledge Distillation","venue":null,"work_id":"ce98cf6a-7a37-4d09-94be-844cf9a785cb","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:10f5f44239008c444d10c82243a19ddb4e104e10ae23b1593c96e6ad4bf3848d","observation_id":"ae84b236-cebe-4939-931a-fc09e2da170b","resolution":{"observed_at":"2026-05-23T07:42:45.101342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2402.05406","doi":"10.48550/arxiv.2402.05406","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Everybody Prune Now: Structured Pruning of LLMs with only Forward Passes","venue":"arXiv (Cornell University)","work_id":"f33b34c7-9c91-4eb5-ba6f-d1a69dbe552d","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:1336042951920b368712fab5953b0d0ed2ed33652848c42b5dd5803784a3cdb4","observation_id":"a9bc8201-24ed-4ba1-9593-5b6c2256b0e8","resolution":{"observed_at":"2026-05-23T07:42:43.149362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPTQ: Accurate Post-Training Quan- tization for Generative Pre-Trained Transformers","venue":null,"work_id":"056202d8-ece7-4dc4-abac-5c19a19bf9e5","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:eb97a93bf58117f161c43d5e7c7dec746cffd1200a7153c6143a33d941d2bcc5","observation_id":"be766e94-660f-42f8-8fca-43666945ccc8","resolution":{"observed_at":"2026-05-23T07:42:45.106108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":null,"work_id":"7f41fa1c-2742-4f0a-a4e6-51ffcd84a470","year":2021},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:03946b2bb6da9243491d3e2847185fa90d22ca06cff0e00a0add95e2c82ccc43","observation_id":"60f5bdd0-3df4-49b6-a5f3-6ec1bc50dc64","resolution":{"observed_at":"2026-05-23T07:42:45.118346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DoRA: Weight- Decomposed Low-Rank Adaptation","venue":null,"work_id":"8b4fa03b-2bd6-4e4f-9c31-4fe904200006","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:63b3be34b12c1fec339f383f47968220c2a363be7d342944d43e7da91712b46d","observation_id":"0c4f7e19-de2c-45c7-846b-7172114b5793","resolution":{"observed_at":"2026-05-23T07:42:45.153608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QLoRA: Efficient Finetun- ing of Quantized LLMs","venue":null,"work_id":"bacc75e4-7b65-49d9-be5b-5c9c4976f3f7","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:6a4f6d2a7d444d6e660bfde86d5765b8538750b4dba32f48decce2cf9de9561a","observation_id":"8a622607-903e-4f87-a51b-ed3b40ddfd4f","resolution":{"observed_at":"2026-05-23T07:42:45.187526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GaLore: Memory-Efficient LLM Training by Gradi- ent Low-Rank Projection","venue":null,"work_id":"ceb7325c-3748-4304-bd7d-713b1d87e589","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:721ba834d0c5107aaff4cfd700d89f77552d40c512e4c1b17b23252005949fa0","observation_id":"6d67f1e4-b2a7-4c76-8162-f911cb025cdd","resolution":{"observed_at":"2026-05-23T07:42:45.077516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:4055379b03670b2d7b7601f4e61d42b57d80bbca0bcb8c13659dfa129feb4740","observation_id":"12465fea-7643-4fdb-a10f-7759182e5100","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-08-12T22:59:05.910546Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":"2408.12637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-07-04T05:39:39.660194Z","title":"Building and Better Understand- ing Vision-Language Models: Insights and Future Directions","venue":null,"work_id":"54aead52-8316-437d-a6cd-78609af679f2","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:5139bcf445a52c7e47e11858485d2b8c174890176bfe4c3b5e8097e85c476318","observation_id":"2ca4f020-57c9-4508-95f9-499a99c5fe63","resolution":{"observed_at":"2026-05-23T07:42:43.129247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PDF Associ- ation Dataset (PDFA)","venue":null,"work_id":"9208073c-9136-4244-b1ea-3120b1e405b3","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:3b33ddfa504db122ef8ae8f87cf4239fc1a93eaef5cdfdd629fd2b630f9e58e0","observation_id":"f58c8bef-486f-48b2-a869-2c475a052ca8","resolution":{"observed_at":"2026-05-23T07:42:45.069065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ICDAR 2019 Competition on Large-Scale Street View Text with Partial Labeling","venue":null,"work_id":"75509962-a0c8-4ca9-9650-e55094227b8f","year":2019},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:e0cc5c0c556d5a807c89842c339915480779572da82581ba565d6d3dd6d369d5","observation_id":"68029f20-cedd-4d18-b4ab-e4e25e70a08d","resolution":{"observed_at":"2026-05-23T07:42:45.073587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ICDAR 2019 Robust Reading Challenge on Arbitrary-Shaped Text","venue":null,"work_id":"78eb8dea-a1d0-46ef-a13e-7a988746656f","year":2019},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:4c7f8064bd972116bb2626e86847a9ba3a99bd4c568040a02c490f194f28348f","observation_id":"fba87277-fe75-4583-95ac-b8fe163a77fb","resolution":{"observed_at":"2026-05-23T07:42:45.081203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"COYO-700M: Image-Text Pair Dataset","venue":null,"work_id":"8bf76083-1c04-4197-b180-85f9b2ed41e3","year":2022},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:09e1c51dec09b6b3926a3f9c4798f8b8d429166f923a946d252a20e1d58861ba","observation_id":"5a6750c8-025c-4166-bb09-d605f1438115","resolution":{"observed_at":"2026-05-23T07:42:45.085385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":2,"unresolved":1,"verified_exact":36,"verified_fuzzy":60},"total_outbound_references":147},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 147 outbound references and 43 inbound Pith citation observations for arXiv:2412.04468."}