{"as_of":"2026-08-12T04:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e8384cf6c0116d6a977ed527cba098c5439f28ad1d9f75e02f43f643328d228","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:52:57.225192Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.12735/citation-record","integrity":"/paper/2412.12735/integrity","json":"/paper/2412.12735/citation-record.json","paper":"/paper/2412.12735"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.008460Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.008460Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:e179284459b5cd16f2b249433cc1e8c8f9d814a7d144434a65facc6501bad10d","observation_id":"2dcfc16d-07e7-4520-b819-f58cb25181c5","resolution":{"observed_at":"2026-08-11T13:52:57.008460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.014345Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.014345Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:fe081f8f579a34c88b13d9209d7c7b676fc7a9b62edb80ce0cb62a61fea25082","observation_id":"ccf1e047-37db-4ede-a275-7a60d030dab3","resolution":{"observed_at":"2026-08-11T13:52:57.014345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17463","last_updated":"2024-05-29T05:44:58Z","snapshot_observed_at":"2026-08-08T06:34:37.983363Z","submitted_at":"2024-02-27T12:39:23Z","title":"Training-Free Long-Context Scaling of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17463","snapshot_observed_at":"2026-08-11T13:52:57.018380Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.018380Z"},"links":{"cited_paper":"/paper/2402.17463","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:a8ade104f4db7b9c1f7c5d34d77c992195a5c7b58c9791f478e68bc4937ad5af","observation_id":"81c81897-6316-46f1-b41c-93a5ea47eff0","resolution":{"observed_at":"2026-08-11T13:52:57.018380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18745","last_updated":"2024-10-24T13:51:50Z","snapshot_observed_at":"2026-08-06T10:59:31.363202Z","submitted_at":"2024-10-24T13:51:50Z","title":"Why Does the Effective Context Length of LLMs Fall Short?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18745","snapshot_observed_at":"2026-08-11T13:52:57.022710Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.022710Z"},"links":{"cited_paper":"/paper/2410.18745","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:3e05ef48e4f3f26d141b1128cf6fce60bc540fa2d526907d32da90c692c7f8b4","observation_id":"a9dd32fa-fb61-4bec-99dd-d3059e8d4dc5","resolution":{"observed_at":"2026-08-11T13:52:57.022710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T13:52:57.026749Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.026749Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:91493473c019054491955a6d1f88b60cb3e900fdfedc9b44448d72f77d0c89f3","observation_id":"4351508a-781c-4c02-a763-0042b6bd6997","resolution":{"observed_at":"2026-08-11T13:52:57.026749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18058","last_updated":"2024-01-31T18:29:39Z","snapshot_observed_at":"2026-08-08T23:35:36.736017Z","submitted_at":"2024-01-31T18:29:39Z","title":"LongAlign: A Recipe for Long Context Alignment of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18058","snapshot_observed_at":"2026-08-11T13:52:57.030461Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.030461Z"},"links":{"cited_paper":"/paper/2401.18058","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:99318be4679fbffdc0da9eb25db8990e6aad63a2a20778438379d3f410d07d5a","observation_id":"a2a2a2c2-20de-4064-bcca-d5c16c17ae04","resolution":{"observed_at":"2026-08-11T13:52:57.030461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-11T13:52:57.034144Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.034144Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:d492b33e49d7c631b071bb455760538b90425984c1e98a1f9e7fe2de01c819fe","observation_id":"29d34610-de14-4dab-b07d-a1ecdabf9cb4","resolution":{"observed_at":"2026-08-11T13:52:57.034144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-11T13:52:57.037972Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.037972Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:d0ca2b26eef32ea624ec122a66d20ae839b096fb852881683c61a91e9aef6207","observation_id":"d547b8b2-6939-400e-8813-961cde1eec81","resolution":{"observed_at":"2026-08-11T13:52:57.037972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:58.099856Z","title":null,"venue":null,"work_id":"454f1306-f447-4894-a593-07e7f9462b09","year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.041765Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:a42211a2079eaa03da00eccc331bf2b2d5dbc34d461df524ce5622fa1dc4d59e","observation_id":"a08b6390-119e-410e-a0e1-19ed29d913f7","resolution":{"observed_at":"2026-08-11T13:52:58.103697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-11T13:52:57.045374Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.045374Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:a8e3ee9a79286717b7d39e5546949b3c3d2a1c4a1657a9d5486062100d5179c5","observation_id":"af0ddcb4-6675-4e21-a28b-365687bb4553","resolution":{"observed_at":"2026-08-11T13:52:57.045374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.048852Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.048852Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:2774eb7d374d855e68c41307bfb6b6b49af615db1f53a5b438535753eae9a483","observation_id":"b558fd6f-c168-489c-9493-836982d6a573","resolution":{"observed_at":"2026-08-11T13:52:57.048852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.051960Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.051960Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:05858e4cb4dbed9c8028a7187435ecdbc811a4f2d94403768ca7e57381d2512f","observation_id":"5d061051-915d-4015-b771-20bb819c5115","resolution":{"observed_at":"2026-08-11T13:52:57.051960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.03982","last_updated":"2019-10-29T06:26:37Z","snapshot_observed_at":"2026-08-07T04:39:24.613881Z","submitted_at":"2018-12-10T18:59:07Z","title":"SlowFast Networks for Video Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.03982","snapshot_observed_at":"2026-08-11T13:52:57.055375Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.055375Z"},"links":{"cited_paper":"/paper/1812.03982","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:5f1ba74a98d19add12683a1af016a8b4953c2a77bdae6a738ea8fc84d6d0589a","observation_id":"dd8a30ca-cf04-43e0-92ab-4b9919b549bf","resolution":{"observed_at":"2026-08-11T13:52:57.055375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T13:52:57.058793Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.058793Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:132b88dc4c920f30fa20b2be14f5ed31997c74b968a1757131f130e774ed7332","observation_id":"a1834679-23ab-4180-9f05-16c2e846a4e7","resolution":{"observed_at":"2026-08-11T13:52:57.058793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-11T13:52:57.062343Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.062343Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:30a8afc0a82d21ec5c866caf9167cc96ad9f2a380a94dbde62e364bbfd6dac18","observation_id":"89300531-3d8e-4416-9ad8-794e839ee30d","resolution":{"observed_at":"2026-08-11T13:52:57.062343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T13:52:57.065731Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.065731Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:f1b9e8ef77c24282cbd71bd2b3fa018338cd37670bdae1b0fd31ed7bdadf78ba","observation_id":"f743acbe-c706-4107-a2f2-b81bf92ef702","resolution":{"observed_at":"2026-08-11T13:52:57.065731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:58.077545Z","title":null,"venue":null,"work_id":"3aa47203-d242-461a-a0b0-a9b48497689e","year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.069160Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:4485a396afed9c68a764536bac3716c9b0d554d4ddc7bd124cb2e188be535e3c","observation_id":"9c075e71-43ea-4df9-bb9f-93a9c2ea915a","resolution":{"observed_at":"2026-08-11T13:52:58.081212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.076132Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.076132Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:a04928f18e82366ea1ccff1db04eea1acd9072a070e81eae190f1d53ec5a8248","observation_id":"f07333e1-9073-4a84-8116-313acf5ca227","resolution":{"observed_at":"2026-08-11T13:52:57.076132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T13:52:57.079187Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.079187Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:a159943b6da8a7a79ee8c8ae5b7cbb6725eb16065fb585e26c51e60797a421c6","observation_id":"5f492940-9c1e-45b6-b636-a26dfe13d8dd","resolution":{"observed_at":"2026-08-11T13:52:57.079187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.082728Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen - Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.082728Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:5d27821181276a2ad2d10b6c02a93909374f1c981427ee6092289d936cd4e7bc","observation_id":"bb9c01c4-71d7-40b8-b144-77fa99e4f328","resolution":{"observed_at":"2026-08-11T13:52:57.082728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-11T19:41:42.384717Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-11T13:52:57.085731Z","title":"Ku, Qian Liu, and Wenhu Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.085731Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:0038d84979ef5e303209dd016778deec09f1ae3a7e634e3d4b3efa4f68b2de23","observation_id":"675a55bd-2e84-47bb-a331-f6457955a0e4","resolution":{"observed_at":"2026-08-11T13:52:57.085731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-11T13:52:57.089252Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.089252Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:e7d5f152eef97405942e0eb65f72c14e562ab07374e5fcd1ce84fb00216acd50","observation_id":"961d1d6e-3efb-4fc7-9d2e-12dca1d937e0","resolution":{"observed_at":"2026-08-11T13:52:57.089252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-11T13:52:57.092848Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.092848Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:4c0ad354f61ee813c7e0d781eaec8b91b8ada1444f5f5a382e27f8d8ef79bf63","observation_id":"9d7ee437-7529-442d-9bd9-58f0ba233421","resolution":{"observed_at":"2026-08-11T13:52:57.092848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:58.059905Z","title":null,"venue":null,"work_id":"84d2376d-e31f-4fe2-97b7-b15a8071af59","year":2022},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.096191Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:3a9b99e90387c59354464d20b9b74f3396677d1a01df5ed0fc44f61919f537e9","observation_id":"2da2df34-2ee6-4cf2-b86e-b5042ec76380","resolution":{"observed_at":"2026-08-11T13:52:58.063682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-11T13:52:57.099585Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.099585Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:99f6644e0d5dde41eec5fcc7bd1db04ccde21bbeee5f295eaabb1f9c7183302e","observation_id":"978d9c79-25e9-482a-a527-83062b2b5560","resolution":{"observed_at":"2026-08-11T13:52:57.099585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.102968Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.102968Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:3efc734f903e037dc7b7ccc285ec38c209bcf8a393e3ba7ae37bd6d975a05684","observation_id":"b5b17f06-a8c1-409d-bc31-b403998fca68","resolution":{"observed_at":"2026-08-11T13:52:57.102968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-08-10T20:41:01.172916Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-11T13:52:57.106265Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.106265Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:b6aac074a667be6bd6c0e7daa7e81f2bc4124eb3e09eed07b9c0bf9a16accdf7","observation_id":"12952629-216e-4600-8d99-dee8bdbf7ebd","resolution":{"observed_at":"2026-08-11T13:52:57.106265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T13:52:57.109673Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.109673Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:44cb5ff3958df7ca7e70f13f6929274c0bbb05748623d2e9cff456ae096e079e","observation_id":"0522cd55-09d1-497e-a29d-8c1ef02e290a","resolution":{"observed_at":"2026-08-11T13:52:57.109673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:58.048591Z","title":null,"venue":null,"work_id":"d2a8c6fb-1ebe-4283-bf3e-0126de3eedc1","year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.113288Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:30ece48631518a325f530132dd0fb19109d4ec901a129f65a0c1597018493473","observation_id":"9da6e79b-8d81-45b3-90e9-6d425b8fec82","resolution":{"observed_at":"2026-08-11T13:52:58.052571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-11T13:52:57.116326Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.116326Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:98214f5d0cd388af87710264bd59383f538f9aa538daa9e2fa02c4d1d10233bd","observation_id":"10fc13bc-9154-495c-9644-f2a0722aa6bf","resolution":{"observed_at":"2026-08-11T13:52:57.116326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-11T13:52:57.119801Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.119801Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:61880905201552d675f5aad427161f98ac303174ab20bf1631cba5e66116e630","observation_id":"bac83baa-919a-4e5c-b093-0183f15e2861","resolution":{"observed_at":"2026-08-11T13:52:57.119801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T13:52:57.123240Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.123240Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:6384c1f6c6f9355e7e5d95c57481eea691166cbea5bd4f66f4daf7097716c688","observation_id":"e815a367-7e79-413a-bb5a-7aadad4a93d9","resolution":{"observed_at":"2026-08-11T13:52:57.123240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-11T13:52:57.126790Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.126790Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:5aa3ade950f6fbde8b46ea3fd092662c09b96c1c0668566f75aabed2ae501b7f","observation_id":"ddbe5737-ef40-4d1a-912a-537731729393","resolution":{"observed_at":"2026-08-11T13:52:57.126790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11833","last_updated":"2024-10-29T12:34:11Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:47Z","title":"MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11833","snapshot_observed_at":"2026-08-11T13:52:57.130337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.130337Z"},"links":{"cited_paper":"/paper/2406.11833","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:292e0d968440e8dde321192ae16e10d64e4af38339e4f316eef70fd7a81f4277","observation_id":"98dfef0f-a47d-4f1e-9919-aafa5b46d6cd","resolution":{"observed_at":"2026-08-11T13:52:57.130337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:58.036820Z","title":null,"venue":null,"work_id":"1a34f8df-d08e-4015-bb6a-a19b78ab41da","year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.133759Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:bdc86b13b0f1a834bc899eee1b874d117c3d9323279391c53a93e501ea8ead28","observation_id":"3bea4e0f-9112-4b05-bd55-2e3dcc715367","resolution":{"observed_at":"2026-08-11T13:52:58.041224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:58.025178Z","title":null,"venue":null,"work_id":"7050cca2-656a-41dd-92ee-52cc1060dfef","year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.136930Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:28d352039ea92b795fa177bf990caf6a4320e2b06bac1ee75046c7a298f066e7","observation_id":"0dfaab4b-8d98-403c-8cba-c45de2b8efb7","resolution":{"observed_at":"2026-08-11T13:52:58.029301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:58.014442Z","title":null,"venue":null,"work_id":"8ad45ba8-e5b8-4558-b131-5d528876413c","year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.140054Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:c15a3fd6b3ed1d0a25c223ab2eb089a914796279deb03dc47ab377c5c5a5cc2b","observation_id":"c4d95314-2c89-4514-98be-049927005d14","resolution":{"observed_at":"2026-08-11T13:52:58.018345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-11T13:52:57.143311Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.143311Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:19be995f0f210c1cd72c643603854448716da9d160fc47f06678be28f52a8aeb","observation_id":"709b09af-8f3b-4fb4-85e5-822d1e66504a","resolution":{"observed_at":"2026-08-11T13:52:57.143311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.146701Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.146701Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:f4a199159e2dfb100bf0e6866388d8a3a2a14be5efa84b6b3745bcbe3cb1d9b2","observation_id":"0f3ed3e4-2436-4fa5-b4fd-3e1941f08c1e","resolution":{"observed_at":"2026-08-11T13:52:57.146701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-11T13:52:57.149783Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.149783Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:fd39d0571cca9852e3255f136dc74eb84793c1d46ef60790fc42890d5ea047f4","observation_id":"ef15c730-7ab6-4724-817f-3f416cd663c5","resolution":{"observed_at":"2026-08-11T13:52:57.149783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.996944Z","title":null,"venue":null,"work_id":"787f8bee-ff7b-490a-a480-c9ba0687ec3d","year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.153312Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:c1ae297386b9490d4d17b7b3a0d7c01651c8fdf175afdb5dca735ee322c8b531","observation_id":"ca2486ac-745f-496d-a356-8c207822161f","resolution":{"observed_at":"2026-08-11T13:52:58.000973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.156602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.156602Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:238b0be34016efc3208979e0c1e4b4c0da3e631641163475712ded1252a7f611","observation_id":"cb65775c-9940-45b6-89db-55280d35a964","resolution":{"observed_at":"2026-08-11T13:52:57.156602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10554","last_updated":"2022-12-20T18:56:20Z","snapshot_observed_at":"2026-08-09T00:51:36.452647Z","submitted_at":"2022-12-20T18:56:20Z","title":"A Length-Extrapolatable Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10554","snapshot_observed_at":"2026-08-11T13:52:57.159727Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.159727Z"},"links":{"cited_paper":"/paper/2212.10554","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:dd0bf8e5a7c884962555919893c4c410a9c026d079be5cc0e468f20ac2954cc8","observation_id":"dc934de4-1b24-41b2-b737-87bd7325a224","resolution":{"observed_at":"2026-08-11T13:52:57.159727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-11T13:52:57.163241Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.163241Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:e8b57ebfcea98fcb07195f86c5792acd9fcbb6a15e6b41df6b57a0a1acb77e3d","observation_id":"a756a6fe-e069-46d5-ab28-00674315cbd6","resolution":{"observed_at":"2026-08-11T13:52:57.163241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T13:52:57.166879Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.166879Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:16c9e7c0bb5ef235392d81dca12c2f59a7f2f906c22d9c92fcb2ddeea4844cd0","observation_id":"e22036f3-f643-4e47-bafb-7be7896b70a4","resolution":{"observed_at":"2026-08-11T13:52:57.166879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T13:52:57.170062Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.170062Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:79eb1dcfcbd40814e41928dab8fe7bb32e6418799820e9e5fc8c25eda0da0f51","observation_id":"80ae5947-48ac-4754-b805-abdefc72b2b1","resolution":{"observed_at":"2026-08-11T13:52:57.170062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.173528Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.173528Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:4e67eb0a381a276c7286d87c2e5c1a7736d17b7a51483febd87b7e7f4b9f5c47","observation_id":"9c6370aa-cf45-430f-85b5-ead9134862ca","resolution":{"observed_at":"2026-08-11T13:52:57.173528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-11T13:52:57.176808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.176808Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:64fee2e0145da090726fd954c072e1bf32363be126ca8a77f21c38ba306bf5ac","observation_id":"1d1af7f1-7ea6-4bf5-b7af-944bef1cc46d","resolution":{"observed_at":"2026-08-11T13:52:57.176808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.985864Z","title":null,"venue":null,"work_id":"5e142ace-e2de-492e-93cc-4a5b23f5d977","year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.180300Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:9979ff3919922e7ae9c5f62c38c8d7bd8249db8eb5bec647a46008afe3cd050f","observation_id":"86f9e18f-2976-4668-a5b2-9efddf3b0a3c","resolution":{"observed_at":"2026-08-11T13:52:57.989794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13766","last_updated":"2025-03-11T17:31:27Z","snapshot_observed_at":"2026-08-03T10:33:33.362949Z","submitted_at":"2024-07-18T17:59:30Z","title":"Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13766","snapshot_observed_at":"2026-08-11T13:52:57.183419Z","title":"Gonzalez, Trevor Darrell, and David M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.183419Z"},"links":{"cited_paper":"/paper/2407.13766","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:26f49135599f8a24428000f78dbdd7baa20dee49d4d2c1330579968825c0592b","observation_id":"5c9abfd0-f032-491f-8137-ab3180bbf295","resolution":{"observed_at":"2026-08-11T13:52:57.183419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.974052Z","title":null,"venue":null,"work_id":"d926f01b-1235-489a-b4c6-d0ef984e464d","year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.187039Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:99f0486a624148dcbd0b410cb7ea8127c4658ff719af2baa3affe293d8c01878","observation_id":"355e61a9-5474-44fd-8a7c-854e220cc851","resolution":{"observed_at":"2026-08-11T13:52:57.978405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.190148Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.190148Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:eaa86a811eb9527b4e0d73438d8c1dd7b825509f0c4e0b87c8bace378164220d","observation_id":"f4d7ae47-6970-412c-bc50-f5048af92f5d","resolution":{"observed_at":"2026-08-11T13:52:57.190148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-11T13:52:57.193369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.193369Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:fbe2eca0d4aa12b12f23068f431d6de1b9a46765f0a6558c2bb0d14d920e4b5f","observation_id":"242a68af-21f3-40db-b0b2-456ba3e78a2a","resolution":{"observed_at":"2026-08-11T13:52:57.193369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-11T13:52:57.196807Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.196807Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:b8682532896c6e9682aab7329f3003f480a3358e9b85b5b1b23b3c4e840d99c7","observation_id":"0aa71577-1f22-478c-9ae9-b8689e182619","resolution":{"observed_at":"2026-08-11T13:52:57.196807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-11T13:52:57.200325Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.200325Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:12c3ed75d3fc32b7c895ea53b0388239f71409ca94c5e075e2ebcdc72aa86092","observation_id":"9f7ee3c2-44ea-46d2-83c0-05b0f1986b22","resolution":{"observed_at":"2026-08-11T13:52:57.200325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-11T13:52:57.203832Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.203832Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:c957dd375f56b38bc6b1f0db7c82dd5964ad542ff1e78f1d6cc9e403888ae8bc","observation_id":"556af101-79d9-4455-997b-c2bc0867fcf4","resolution":{"observed_at":"2026-08-11T13:52:57.203832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T13:52:57.207839Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.207839Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:5f7329a7bf39ba84eb31ba619f052f8433f36d7fe810eb089ebf5eeaf762bfde","observation_id":"139c5f36-f880-4f55-8ca9-d5c75a11ef7a","resolution":{"observed_at":"2026-08-11T13:52:57.207839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.955932Z","title":null,"venue":null,"work_id":"14c4ee2e-c60e-4dee-bc30-e7651f523fba","year":2023},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.211293Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:5aa72133f3d9c25f161db918f8c27bb5223d639f5f2603ae598420cdf865cff3","observation_id":"12074ea3-c5e6-478b-a1fe-74048382e5d1","resolution":{"observed_at":"2026-08-11T13:52:57.961123Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.214469Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.214469Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:1ac85f4fdd8511da16bc00f694a74fbe464a10f96197438ac7f11bdd0300b4d3","observation_id":"10647a01-123a-413e-90a5-e15ca231085b","resolution":{"observed_at":"2026-08-11T13:52:57.214469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.218185Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.218185Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:80e2e2f743c1203a9aadb6ba9820c6baf01b00c9c1c4d3a83735729285d52cc2","observation_id":"fce838dc-b3fb-460e-96bb-29b3c9796e81","resolution":{"observed_at":"2026-08-11T13:52:57.218185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.221740Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.221740Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:fb15d00e138c1f1ff94fa724e16ba91bd6791b0301782ce4abaf8d98da7a4459","observation_id":"8be063b8-29c6-44cf-8ba5-167b8a7b9650","resolution":{"observed_at":"2026-08-11T13:52:57.221740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:57.225192Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.225192Z"},"links":{"citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:281d99f0638edae206a2d43e68410cd67f1f17f5811c95fa7da1221dfd2a93cd","observation_id":"e28feb92-f2e7-4e4f-98c7-76051339bc59","resolution":{"observed_at":"2026-08-11T13:52:57.225192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T17:35:17.874397Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2412.12735."}