{"as_of":"2026-08-11T16:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c4b060e204991144a36ec1b948049d5248b95340fe9382846f8f71b37819b3a","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T13:38:18.919283Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T23:09:32.594194Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T23:14:01.665133Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"cited_work":{"arxiv_id":"2501.16297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16297","snapshot_observed_at":"2026-06-29T23:14:01.665133Z","title":"Fal- con: Resolving visual redundancy and fragmentation in high-resolution multimodal large language models via visual registers","venue":null,"work_id":"5bf9f96f-4554-4d68-9347-6ea2a87a3960","year":2025},"citing_paper":{"arxiv_id":"2507.23372","last_updated":"2026-05-22T03:38:02Z","snapshot_observed_at":"2026-08-01T18:46:29.354743Z","submitted_at":"2025-07-31T09:39:27Z","title":"UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-25T08:14:28.540629Z"},"links":{"cited_paper":"/paper/2501.16297","citing_paper":"/paper/2507.23372"},"observation_digest":"sha256:90ec37d6fb8d89bdb98a85f2db8026c21dd705664807ccb1f24331138122ce9d","observation_id":"1e720cc7-46b5-45e6-8500-60bd9775742e","resolution":{"observed_at":"2026-05-25T08:15:33.790283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"cited_work":{"arxiv_id":"2501.16297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16297","snapshot_observed_at":"2026-06-29T23:14:01.665133Z","title":"Fal- con: Resolving visual redundancy and fragmentation in high-resolution multimodal large language models via visual registers","venue":null,"work_id":"5bf9f96f-4554-4d68-9347-6ea2a87a3960","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-07T06:01:09.371896Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2501.16297","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:0d6b51aa1c319503b16029ccda76b76869fd3e814dfd2e58728392513ee4fd5b","observation_id":"308599d9-d0d2-4720-a799-43695fdad954","resolution":{"observed_at":"2026-06-29T23:14:01.667217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.16297/citation-record","integrity":"/paper/2501.16297/integrity","json":"/paper/2501.16297/citation-record.json","paper":"/paper/2501.16297"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T13:38:18.660902Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.660902Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:e99ce2a5287d926b1ce49e79679badc9808f897e4a090b56644fcaa1f198649e","observation_id":"9cecb0cd-669b-499c-b5d1-611b54e4602a","resolution":{"observed_at":"2026-08-10T13:38:18.660902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.646517Z","title":"Lion: Empowering multimodal large language model with dual-level visual knowledge","venue":null,"work_id":"30217902-57cb-420b-b5da-c141615bc541","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.665980Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:1e6e32b6ca45e37639c8f7b35fda5049c20634a29727fa17495ede3f9bcf0043","observation_id":"2930fe71-38c5-4dd1-96c0-cf4eb91f3fa8","resolution":{"observed_at":"2026-08-10T13:38:19.650731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.635031Z","title":"Less is more: Empowering gui agent with context- aware simplification","venue":null,"work_id":"7c1d3f0a-e614-41c6-9b2d-9975ffcc9ab0","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.670578Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:c3e0ebdf2ad4eac4388936e44f0aa39e41a88f3c78da41f907afb7f5721cb83d","observation_id":"00b8b4a7-9f6e-4a5b-9383-1862af359e04","resolution":{"observed_at":"2026-08-10T13:38:19.639220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-10T13:38:18.674964Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.674964Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:c7e54a637d110e5254a81aaa33c8a6e31720dd0fee2e28aed9663d2b24074aad","observation_id":"06f4e848-242b-4446-baae-33a9dde9139b","resolution":{"observed_at":"2026-08-10T13:38:18.674964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.624224Z","title":"Spa-bench: A comprehensive benchmark for smartphone agent evalua- tion","venue":null,"work_id":"37ac6c2b-2f76-42e4-9a39-acf3b44e5ca9","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.679118Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:507f011888b3015e2b04c818feda37d88a8bf4be1f97345f177360f5fb1111c9","observation_id":"48e9b2e3-80b4-4576-bacf-75157864c99b","resolution":{"observed_at":"2026-08-10T13:38:19.628063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.683251Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.683251Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:3d0d3c61f687abe7c292f6b2e744d0ef0dc64746a17726294ff3973ae15da64b","observation_id":"4a044303-7ddb-4633-a91d-549cd3158b58","resolution":{"observed_at":"2026-08-10T13:38:18.683251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.606452Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"f60b16ee-a4a2-47bd-b381-019eed43b468","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.687230Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:5750bc19c8d0c5a6b42666d2c6cc2548865b7b48e883554b8e6b3f670ff83ece","observation_id":"189dacbe-1e7a-47f2-b301-7d58e427a451","resolution":{"observed_at":"2026-08-10T13:38:19.610545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.692030Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.692030Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:4b5c949113fdc05a12063f0ed08db75aaea5bdcc847cfc8b9e90560e18ee25c5","observation_id":"f4d8f2bb-447e-48e7-b1a4-6d90bfe78e25","resolution":{"observed_at":"2026-08-10T13:38:18.692030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.588048Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"08a1f115-cbd5-4e3d-bc57-58d1e5d1d70a","year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.696051Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:1456c8b5b615ea905bf77ad07b76b28d2e1bccda5fc3792731a3519d9799b485","observation_id":"86a2d164-30f3-4be8-878c-2ed042bca62e","resolution":{"observed_at":"2026-08-10T13:38:19.592111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.576827Z","title":"Vision transformers need registers","venue":null,"work_id":"dcface91-c7bb-4e7a-8164-68635d9a94cb","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.699899Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:29611dfaf14047050e4a0b4db81a77a48f1aff621567ca71e65c231eb77abb56","observation_id":"54b7c54b-407f-42a3-a4d7-cae40c478b81","resolution":{"observed_at":"2026-08-10T13:38:19.580813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.703723Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.703723Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:f765958d0337d20110ab116145c1f4b976aa7f87117c99a9d2045f2d93944f17","observation_id":"b05491e6-12f0-4fae-b022-4e138d0b0fde","resolution":{"observed_at":"2026-08-10T13:38:18.703723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T13:38:18.707825Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.707825Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:87d8472531eda5d94f773c01ddfa132f8f02613531421aa86cd80f5e8e7b053f","observation_id":"86885e08-9b0e-4839-b105-0bd5e9780b93","resolution":{"observed_at":"2026-08-10T13:38:18.707825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-10T13:38:18.711903Z","title":"Bridging nonlinearities and stochastic regularizers with gaussian error linear units","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.711903Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:3fa9b844966ce9f291102b83b549f1a3b7022e836222d60aa1b869539c27056f","observation_id":"f0b27731-56bc-4aa2-b96c-c85fdb6faf2f","resolution":{"observed_at":"2026-08-10T13:38:18.711903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-10T13:38:18.716137Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.716137Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:61e4980d09480c58768882b97ed030b245ed878a8372d6726aaae31ef064e2cd","observation_id":"ac01ab06-dbdb-4897-a3e3-12b933609d0d","resolution":{"observed_at":"2026-08-10T13:38:18.716137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.558898Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding","venue":null,"work_id":"a1748172-a958-4362-8ffe-ab826b1937ee","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.720321Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:6439b4435c1af29eb26c6cbc53bfcf804eaf32bf9c5eb07362ab6a39617f2449","observation_id":"33395e58-9e1a-40ff-842f-eee1d6082bc2","resolution":{"observed_at":"2026-08-10T13:38:19.563433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.548132Z","title":"Mini-monkey: Alleviating the semantic saw- tooth effect for lightweight MLLMs via complementary im- age pyramid","venue":null,"work_id":"086830f7-3463-4c90-b133-e5ccf82e2fac","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.724048Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:ebb4fe6f5fca59a64425e501579f2cc57ead151846d8722e76b8da4cca2877a6","observation_id":"905014d2-2ac6-4584-bced-f09eaa7de993","resolution":{"observed_at":"2026-08-10T13:38:19.551976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.537538Z","title":"Hires-llava: Restoring fragmen- tation input in high-resolution large vision-language models","venue":null,"work_id":"25304c71-b74a-4863-a780-447bc2dfc999","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.727665Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:a2be41b4392521a1f59143c3edb600cb67dd415ce390a62fc19b7501e69640ac","observation_id":"156e88a4-8f94-4638-83c2-989d28bd2371","resolution":{"observed_at":"2026-08-10T13:38:19.541358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.526601Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":"c0ad9e9a-e681-4fe4-bdb5-651a08853232","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.731361Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:4c8b0218d9fb8bcc40090b5c12aa9c7e09ca42abb60bf2f984cdda204f59c0ae","observation_id":"6493d439-31b1-4e22-815a-5bd29d58c30c","resolution":{"observed_at":"2026-08-10T13:38:19.530445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-10T13:38:18.735094Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.735094Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:373225d5740d4975326a01a30f1be1714ead3083cbca3d4b9239fdbcc3867f3e","observation_id":"057861c3-7ed6-4acb-943c-0fc7d84e2852","resolution":{"observed_at":"2026-08-10T13:38:18.735094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.739410Z","title":"LLaV A-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.739410Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:320eaacd0e3c5fd6873e29497dad7f6526e2d44d1d4f3981085a10969a6561d3","observation_id":"01559c1a-9d54-4159-b24d-a22c4e2cb7e2","resolution":{"observed_at":"2026-08-10T13:38:18.739410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.509808Z","title":"STAR: Learning diverse robot skill abstractions through rotation-augmented vector quan- tization","venue":null,"work_id":"26d9a85d-088f-4dda-b8a5-9573d03f6f38","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.743525Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:527acb39ae14c8bd436e2d1e483856463b7c6979f54545ee9d751312692bb2fb","observation_id":"dbaafdc9-d0bb-4a5c-8a55-5eb8ee60a24b","resolution":{"observed_at":"2026-08-10T13:38:19.513557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.498096Z","title":"Blip-2: Bootstrapping language-image pre-training with 11 frozen image encoders and large language models","venue":null,"work_id":"f8c25529-13d3-4e90-81a4-cfc2b73659c1","year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.747331Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:9fdb6d01e86e991ba945254c785b0d8107c484b8b44e614b429841e1c89194ab","observation_id":"9773fdbd-b6ca-4420-b586-1ed3a5cdc433","resolution":{"observed_at":"2026-08-10T13:38:19.502224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.487288Z","title":"Flex- attention for efficient high-resolution vision-language mod- els","venue":null,"work_id":"7004598f-4e8c-4b10-bff6-256c76e6fc32","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.751038Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:a7cad8db6f5522145e3850735abdd0dfe037274e740368c2a98ab79f68721fac","observation_id":"05ab51b1-b59b-4d17-88f1-e36a767cf6f2","resolution":{"observed_at":"2026-08-10T13:38:19.491062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.476464Z","title":"Lion-fs: Fast & slow video-language thinker as online video assistant","venue":null,"work_id":"f5e3fe77-c204-4d63-a635-4886152a6a04","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.754766Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:6f2359e2339749f8132e4dddb0a1b625a2f16d9386f2db848612a94254b7e765","observation_id":"3898cb60-9eb4-4ae8-ba70-2caf4890a0de","resolution":{"observed_at":"2026-08-10T13:38:19.480351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.758353Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.758353Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:412875e4a3d08dd3eb83c44373661b30117d0cb972ec25a50e690e5f11f0c797","observation_id":"92305da7-4122-4711-a3e1-2bb26cb96def","resolution":{"observed_at":"2026-08-10T13:38:18.758353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-10T13:38:18.761893Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.761893Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:06d69d24e85bf0b85a9c2f7552b80657d96fcdfff1a295015ca927e0f5bbbda9","observation_id":"a1862721-228f-481c-a619-8369a8c60462","resolution":{"observed_at":"2026-08-10T13:38:18.761893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.459642Z","title":"Optimus-1: Hybrid multimodal memory empowered agents excel in long-horizon tasks","venue":null,"work_id":"e909e531-8a02-453a-93bd-d1274c465d93","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.766280Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:4c523a80f7e70a9a59610acda43fb87430b97f40ec8f43ca6c6a444016eb305d","observation_id":"aa7da1ae-4093-4815-88dc-9d1598f5cd82","resolution":{"observed_at":"2026-08-10T13:38:19.463546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.448415Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"79f1564c-7d93-4744-bdb1-284411d3f48c","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.770199Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:cbc036ea2d84448746e85b59c5060fe4dcab35c597ec5d45686daa33cdf28733","observation_id":"0aa62c3a-5c79-47be-b161-5eb2c705ed67","resolution":{"observed_at":"2026-08-10T13:38:19.452524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.437797Z","title":"Optimus-2: Multimodal minecraft agent with goal-observation-action conditioned policy","venue":null,"work_id":"222e3392-e6a6-46ab-8d6a-73c8a843d5c5","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.773810Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:dcd76bd6c277f0d31869d27062b1016e8acb6c86a36e835db6314fba3f946787","observation_id":"75e8e79f-8633-4bed-bfe3-4ff0824dd92f","resolution":{"observed_at":"2026-08-10T13:38:19.441573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.426822Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"9148dd45-a6e6-4309-a2f7-3a999d2709a7","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.777251Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:82b00788b20ccf391cef6400f9cfc97c15ae35c3412b55a3d3c023a99b32b940","observation_id":"aeb7aca1-8e46-4cf1-bbf9-a55e1f82e333","resolution":{"observed_at":"2026-08-10T13:38:19.430737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.780931Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.780931Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:25c0b5457f5546fc3410c41ae90551e1296ed733f85f8db92c90bcdf83b10bdf","observation_id":"94754f3a-0b0a-49e2-ab02-bb33b379258c","resolution":{"observed_at":"2026-08-10T13:38:18.780931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.784750Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.784750Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:20769ec9be28982cafa9ec8bc29d3028b85acd7fb2340adc16f4c5d190261f4d","observation_id":"403f895a-a8e2-4982-b704-cf18734199f1","resolution":{"observed_at":"2026-08-10T13:38:18.784750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-09T20:40:14.205704Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-10T13:38:18.788312Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.788312Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:e2d051061b4dd0f9ce5e338070a6b8fc40ddcad00ac048f3741623de1d3e18d6","observation_id":"c8afdfd2-f1ab-45df-81a9-258884492a40","resolution":{"observed_at":"2026-08-10T13:38:18.788312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.792560Z","title":"Mmbench: Is your multi-modal model an all-around player? In European Conference on Computer Vision, pages 216–233","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.792560Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:51b8c76154ae584ffd62b3a7f6c76c70836cff677ad269d95fb64a5a15096fa0","observation_id":"99251e67-9df0-41a4-970d-90e9a6a68bf0","resolution":{"observed_at":"2026-08-10T13:38:18.792560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.796210Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.796210Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:77f5ea4f602d16f87102e5be1b453024f30f313caae38e32582c9fcd7233a452","observation_id":"718f2c8d-4842-4d67-9520-ebb223d1e3b8","resolution":{"observed_at":"2026-08-10T13:38:18.796210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-10T13:38:18.800215Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.800215Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:36587f3275d8ec8ccfda3028a708b4d0ce859bc6df76032c5bc4021b4ba66804","observation_id":"80466512-1ad5-4253-a94a-96d2ca4629bb","resolution":{"observed_at":"2026-08-10T13:38:18.800215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.390897Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"4732a44a-d3cb-4800-a176-5733490f812c","year":2022},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.804301Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:50cba174a6b038210afead6eca11114b43fad3cae1d239620fe4575007b37d75","observation_id":"b5245f0b-10fa-4f44-b04f-5b197bbd3d48","resolution":{"observed_at":"2026-08-10T13:38:19.394658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-10T11:40:09.342794Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-10T13:38:18.807983Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.807983Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:21f77091bd40e2d7fdda18538fc578e56294532ae365d7e72a2e54a36bd85dbd","observation_id":"5c6f3f2f-88ce-4b28-aa9a-a977052721d7","resolution":{"observed_at":"2026-08-10T13:38:18.807983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.379722Z","title":"Spatial-temporal graph diffusion policy with kinematic mod- eling for bimanual robotic manipulation","venue":null,"work_id":"74af3a67-1412-4c31-b5be-2d00521c0e5a","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.812074Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:8c5731c4dd58ed48e0ccfc617fdd6f990bea6f7e6774ee828b021136e30becb7","observation_id":"4dfc0037-2743-484f-bd91-0de059dd5dd2","resolution":{"observed_at":"2026-08-10T13:38:19.383566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.368402Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning","venue":null,"work_id":"a0bcf99e-8078-44a9-b5ff-67732da460ce","year":2022},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.816038Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:bed6c5a27aa43811ae1bc161ae24e489fdb8f247a5c2a1fbf39acbc2219cd150","observation_id":"b58f3cd1-f15f-4198-b84a-0ab867f706a4","resolution":{"observed_at":"2026-08-10T13:38:19.372698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.356953Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"808c8588-fa21-466b-b9b8-8a9fbb0bf5d6","year":2021},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.819840Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:a64d8ad3a75c5f671f83ea3d76bcbf68cd1051231793c550ed389e4a9d6743ab","observation_id":"fcf03e1a-d56a-426f-878e-f1710aed48e2","resolution":{"observed_at":"2026-08-10T13:38:19.361057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.823527Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.823527Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:bfcfec7b6ee156943246de67e64902c27a51e516de549dd5f97cf4ae59a255b5","observation_id":"2223dd60-7822-4ab6-8de0-6f1d3d81404e","resolution":{"observed_at":"2026-08-10T13:38:18.823527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.827229Z","title":"Multi-adversarial discriminative deep domain generalization for face presentation attack detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.827229Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:263159d4a8656bdd106314a9cb530b5003d43b57bc98f216654c9c448942d8d9","observation_id":"68d28a54-be9a-4828-b622-3bef84431d87","resolution":{"observed_at":"2026-08-10T13:38:18.827229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.334063Z","title":"Detecting and grounding multi-modal media manipulation","venue":null,"work_id":"816f5ae8-5048-497a-be47-64753b1d6e8a","year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.831549Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:d57cbfd73d46e17597a97c8eb53b8b47d9d3c5a832d6df81fe6784538a417ff6","observation_id":"5682eb4d-25ed-4d0c-909a-1a2eb617661c","resolution":{"observed_at":"2026-08-10T13:38:19.337795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.322945Z","title":"Detecting and grounding multi-modal media manip- ulation and beyond","venue":null,"work_id":"dca129c4-f935-43b2-91d9-54c05dadb59d","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.835497Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:b40abecdc0319f428b39a051219ca73533f6fcc7db4028a9a1928d3edf555965","observation_id":"1ee6b5e4-3a72-463e-91df-12ac496afa7a","resolution":{"observed_at":"2026-08-10T13:38:19.327055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.311959Z","title":"Mome: Mixture of multimodal experts for gen- eralist multimodal large language models","venue":null,"work_id":"3bc83225-1ced-4c03-958d-d21c67755b69","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.839306Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:39f123842517280d112b23a7812d21529177dbb3d3c7fa18e500b5ee2d1b520f","observation_id":"302dd13c-0a73-4068-a2b9-490798c2f71d","resolution":{"observed_at":"2026-08-10T13:38:19.315809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.300940Z","title":"When do we not need larger vision models? In 12 European Conference on Computer Vision, pages 444–462,","venue":null,"work_id":"c7d8f9c6-3fce-4b8f-8192-416a0e4a2e3c","year":null},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.843134Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:3900ee9510902768e5d19af62357e737e82c01b082966a30d79dccf3b1cf8bba","observation_id":"5de446c3-1946-4748-85a2-4b8b58af2f6c","resolution":{"observed_at":"2026-08-10T13:38:19.304740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.847335Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.847335Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:2a73ab9ab118f90db64a7634b66a1e317fec171fb4414615b19ab6820a3a2065","observation_id":"f9db3667-dfaa-4807-a952-860ebba09887","resolution":{"observed_at":"2026-08-10T13:38:18.847335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T13:38:18.851125Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.851125Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:925848ed0c85cdd5fe45c30c42df139733faef21038b06fb8d74f881f5382cb5","observation_id":"36153ffb-5247-473e-a02a-992f25713644","resolution":{"observed_at":"2026-08-10T13:38:18.851125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T13:38:18.855123Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.855123Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:f389b21ea36716889d1b616d01e3ac9c959bac80e372bce247f810439869bf17","observation_id":"279cc74f-b201-40d4-95ba-30f69f6556f0","resolution":{"observed_at":"2026-08-10T13:38:18.855123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T13:38:18.858993Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.858993Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:3515a91f4b02ee48a94db9a03afba84da2b3f69e3be72cccc250d8d43b5fd098","observation_id":"41e6be49-fde2-4170-950c-dea735c419e7","resolution":{"observed_at":"2026-08-10T13:38:18.858993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.283392Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"277a83ca-1b0d-41d5-bc89-e1b6d96a1325","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.863115Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:fb872c0686c8b5e5da9162fd603db0e89a7465c5cf4777f4dbcd7df542e3d23a","observation_id":"5b9a5693-bae5-4f98-b923-48684cfba1b9","resolution":{"observed_at":"2026-08-10T13:38:19.287477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.272227Z","title":"Gui-explorer: Au- tonomous exploration and mining of transition-aware knowl- edge for gui agent","venue":null,"work_id":"88347bc9-e36c-445a-ab8b-67697782bd76","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.867100Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:647b57e5771fde944c1a3e6fe74c606594af70b3ff3cc1a7b52277369fc01489","observation_id":"8caefd48-b66b-45fd-98dc-526a0336d167","resolution":{"observed_at":"2026-08-10T13:38:19.276332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-10T19:26:05.804069Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-10T13:38:18.870758Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.870758Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:b76bcc0a55ca9274e41647aae10ce162ab2d2124d55e315c536723856260f9bf","observation_id":"369d4a1a-0c92-4c72-b617-b8716adcf56d","resolution":{"observed_at":"2026-08-10T13:38:18.870758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T13:38:18.875541Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.875541Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:01303f643f688ca16dad76ecef3013ed1449626572105b8af88a7fe3a0ec7409","observation_id":"9bd10117-1474-4938-a48d-c544a1805316","resolution":{"observed_at":"2026-08-10T13:38:18.875541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-11T01:12:48.131694Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-10T13:38:18.879391Z","title":"mplug-docowl: Modularized multimodal large language model for document understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.879391Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:f23f7a7b336ea97262211e3de8b3fcfbe14963f877e54fb7f05ff8466c1266de","observation_id":"2e866717-1d12-4ccf-bf1b-c775db334c8d","resolution":{"observed_at":"2026-08-10T13:38:18.879391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.257345Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":"b19111e8-3276-430c-be55-235fe8f8763a","year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.883290Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:71ff4be1a88ba52070f3dfd919d9ebe8b0bc24d4f5cdf48e957dfb83002fc893","observation_id":"57e8c7ba-2775-43f7-8808-f8bb8be2a97e","resolution":{"observed_at":"2026-08-10T13:38:19.264231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-10T13:38:18.886964Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.886964Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:1283f13f3742fb6d1a707af754ceea7a7daed30a80bbafc567a265efcc1796f4","observation_id":"3908d8fc-4886-4a77-916b-13a650794a9b","resolution":{"observed_at":"2026-08-10T13:38:18.886964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.236136Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"beb29cdd-1787-489d-9694-6a07b398a960","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.891094Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:cb213e2e2385d904200686caaf670e5dd67085291c23a9a452d4b8b0fb329717","observation_id":"d570105d-11f2-4813-bad3-6a832874fa46","resolution":{"observed_at":"2026-08-10T13:38:19.239916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.224464Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"a6c1b316-c011-4a3e-8504-77872bc6975e","year":2016},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.895145Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:991f22df92f6466a40860f473c4df97345e82149f4449cd07035ad1d44a4dcd3","observation_id":"95e99493-16af-43f9-aacd-7f06afa2fa0d","resolution":{"observed_at":"2026-08-10T13:38:19.228709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.212308Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"a7c3608e-ddd7-46a8-a033-39cc0a21dc6c","year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.899089Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:1d45e12055c85e067d59a1ff76e5d4dbe2f2f061cd6f6be3c9f736cfcf0d044d","observation_id":"288adfb4-a5bb-43f1-96d3-a928edd16fbe","resolution":{"observed_at":"2026-08-10T13:38:19.216519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-10T13:38:18.903154Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual in- put and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.903154Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:e089b350af26573094a54dee946b1264bcdccc386182ef7fb00181d53b1c4d6c","observation_id":"7f24491c-e4a3-4866-b6fe-c2441f230af3","resolution":{"observed_at":"2026-08-10T13:38:18.903154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14439","last_updated":"2024-07-19T16:11:15Z","snapshot_observed_at":"2026-08-07T08:50:49.699503Z","submitted_at":"2024-07-19T16:11:15Z","title":"Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14439","snapshot_observed_at":"2026-08-10T13:38:18.907427Z","title":"Token-level correlation-guided com- pression for efficient multimodal document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.907427Z"},"links":{"cited_paper":"/paper/2407.14439","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:e9b9a7629ac0c3a01b22ccf137a72f0c2dd2a0c6ab79ecbc8f920a7cc65cf63c","observation_id":"8fbc5767-86a4-45e6-85df-5737da82d995","resolution":{"observed_at":"2026-08-10T13:38:18.907427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.194770Z","title":"From redundancy to relevance: Enhancing explainability in multimodal large language mod- els","venue":null,"work_id":"0eff9add-cc30-4b7b-8bbc-0a1e8c5e0cf7","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.911600Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:4f4c146b1529fb89d6129bb85654019404ee97fb7b9e79094a4a77dafa56458e","observation_id":"ac5d1f9d-a70b-4c35-8dde-30a233ecbc2c","resolution":{"observed_at":"2026-08-10T13:38:19.199802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.181397Z","title":null,"venue":null,"work_id":"2d916286-9c62-4ad2-b2b4-09f2e4b973c6","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.915446Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:de063cfcd78f86db83aae5a8bb54b46c945282734574bf72888554920935eab2","observation_id":"5a52d847-6c2a-401f-a6d0-37d6db3f6f4f","resolution":{"observed_at":"2026-08-10T13:38:19.186362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-11T01:31:43.600162Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-10T13:38:18.919283Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.919283Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:da887b798e845e440b8be3ba826469b5bf4a4b4bea7f2e0d83722ca2f331a49f","observation_id":"b382da80-0c94-48de-b22d-f2e8fd4ba5eb","resolution":{"observed_at":"2026-08-10T13:38:18.919283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T13:32:23.382061Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 2 inbound Pith citation observations for arXiv:2501.16297."}