{"as_of":"2026-08-13T10:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b89ba97448ed70d4302df6941f82d26f2eb9477c2aa1cd9de9bf89ab9b51a9dd","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:38:23.397829Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.09919/citation-record","integrity":"/paper/2412.09919/integrity","json":"/paper/2412.09919/citation-record.json","paper":"/paper/2412.09919"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.529985Z","title":"Accessed: 2024-09-30","venue":null,"work_id":"e748ca4a-8164-4efc-930c-bd2b8fde43e3","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.085961Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:e12b77435e9523969514a827ff93f3324315d1329f8a14faecec863629bf4a15","observation_id":"6e269592-11af-445e-aa6e-a0cf055d1045","resolution":{"observed_at":"2026-08-11T16:38:24.534530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.515721Z","title":"Flamingo: A Visual Language Model For Few-shot Learning","venue":null,"work_id":"ff9ba05f-9aa8-4cb2-a09e-6de253a8dc5d","year":2022},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.090969Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:254c9bf5cb3a64529bd43bcda707dc8fdaa139a67849ad0bf74009b21c89bff6","observation_id":"5cce60a5-a4a9-4ed6-90ef-b513cafce434","resolution":{"observed_at":"2026-08-11T16:38:24.520243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.500252Z","title":"Deepspeed-Inference: Enabling Efficient Inference of Trans- former Models at Unprecedented Scale","venue":null,"work_id":"84a1e6d7-4ffe-4854-bc36-7c4a4dc7225d","year":2022},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.095827Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:7b730f6150ea540918e05d9d8e1b6e9858b7137ef15ac6c79feac74d49c77495","observation_id":"5b1a2745-d8f5-40b8-8072-e37ceeccd44d","resolution":{"observed_at":"2026-08-11T16:38:24.505394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T16:38:23.100815Z","title":"Qwen Technical Report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.100815Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:d23626af3c7e5c20c9c23c0dd15b1c5001694ec91ab991002ccdb7bc47def38d","observation_id":"0ed46894-0977-4b78-b1a0-fcc333a4411a","resolution":{"observed_at":"2026-08-11T16:38:23.100815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.484916Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"073dc80d-b390-4014-8cf2-ff3f951d5f70","year":2021},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.106163Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:b59189dcccec0d1b6ccb6a64e05b56a5ccd2f5848bbf34956b7bbdc61cd5cb62","observation_id":"24e6e467-6e9d-48d9-84df-282eb0896330","resolution":{"observed_at":"2026-08-11T16:38:24.489843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.467279Z","title":"Token Merging for Fast Stable Diffusion","venue":null,"work_id":"4bc50796-3bcc-4768-b75e-4b1c2653e624","year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.111065Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:d2a0542a5ddfc67847e463bfbdb3255731f8363032edcde0b3e415a4bb1c6bb4","observation_id":"66863b66-26b1-4de9-999c-5059196ed2d0","resolution":{"observed_at":"2026-08-11T16:38:24.472817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.451657Z","title":"Token Merging: Your ViT But Faster","venue":null,"work_id":"9dd443af-fcdd-44fe-a464-509a6fe1fe22","year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.116301Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:671bfd2011c9318a8dbddc2ad31ab2bbd7cd37400e4e557a06edaa3e080d91d1","observation_id":"165db5d1-38ec-480f-bb5e-65fb6fdd29d3","resolution":{"observed_at":"2026-08-11T16:38:24.456825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.435581Z","title":"Dif- fusiondet: Diffusion model for object detection","venue":null,"work_id":"dd141bfb-2b98-45c3-9c8b-c49741d75c90","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.120851Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:bfed807069e335cba7458962152bbc909f94a127c3e968ff29dfe933df1399f3","observation_id":"fb4e4d0b-64f3-44c5-bbd6-066c0d878c26","resolution":{"observed_at":"2026-08-11T16:38:24.440804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-11T16:38:23.125642Z","title":"VideoLLaMA 2: Advancing Spatial- Temporal Modeling and Audio Understanding in Video- LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.125642Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:dc4afc006dab50af68685392b84f59afa7db04a24d097044a7473bfa8f0fa99f","observation_id":"97cfd238-8e33-4990-bfe2-38f7dded1efd","resolution":{"observed_at":"2026-08-11T16:38:23.125642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T02:40:23.887636Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T16:38:23.130731Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.130731Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:3d7cccd5b948fe79d75ebbd7c915aa8fc9c474b93cab41b37c976404726edbe5","observation_id":"4a20ac0e-7c12-4615-828d-320b0218b5bb","resolution":{"observed_at":"2026-08-11T16:38:23.130731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T16:38:23.135791Z","title":"The LLaMA 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.135791Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:f66b2efe0726da92b96227e426e8cca2a3606ea968415234fc81a17704188831","observation_id":"7c5aca54-ace4-42a8-8118-b1de65e80b0e","resolution":{"observed_at":"2026-08-11T16:38:23.135791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.417005Z","title":"ActivityNet: A Large-Scale Video Benchmark for Human Activity Understanding","venue":null,"work_id":"0be39ed7-20bb-41bd-867b-fc50e5d9ce54","year":2015},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.141476Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:115ae370053291bb349e47b5f5f71c7e5c1bebc1a86d3b167f1af604af76d7a5","observation_id":"2330e1df-0570-4baf-9e50-13fe6758d348","resolution":{"observed_at":"2026-08-11T16:38:24.422363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T16:38:23.146380Z","title":"MME:A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.146380Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:4190722b17aec66de51569239aa2ffe553140409517239a19f01ec023d3c147a","observation_id":"6c8bf51d-4b97-4f92-8a27-f03d3374c844","resolution":{"observed_at":"2026-08-11T16:38:23.146380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.402528Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models, 2024","venue":null,"work_id":"a43b2f47-7cde-44ac-b964-051e84f586ce","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.151391Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:b53757cf17f82eaf6e2d6b31caca5de4e1fb44957161975ef03d7f414a091fd1","observation_id":"8781f6cb-a499-4491-b7e3-42c24537ec2a","resolution":{"observed_at":"2026-08-11T16:38:24.407378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-11T16:38:23.155758Z","title":"Video-MME: The First-Ever Com- prehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.155758Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:c8338df6ad7c453a4f3792f6ac1e4b049353f1182047f441a89def4dfb1dc502","observation_id":"3f706293-107d-4993-bbd4-e83e824ee93d","resolution":{"observed_at":"2026-08-11T16:38:23.155758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.388018Z","title":"Making the V in VQA Matter: Ele- vating the Eole of Image Understanding in Visual Question Answering","venue":null,"work_id":"34ea2f49-a034-4654-ac42-43f3739dca68","year":2017},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.160786Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:0eaa7ada977b0f2e0f0d4f0ce89bee1c319e9dbd707ab96a7131ce40afac76b2","observation_id":"e8f1a4dc-1609-4fb8-9d2b-03606732a319","resolution":{"observed_at":"2026-08-11T16:38:24.392962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.373198Z","title":"Vizwiz Grand Challenge: Answering Visual Questions from Blind People","venue":null,"work_id":"d078cf0f-193d-4033-aa75-93c3372fbbbe","year":2018},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.165606Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:da0904f70da94170b40eb7e2fd58691abf8d81658c6eb4d3b2d69e3c53130cab","observation_id":"f1228d8d-5a4c-4164-9e72-a3f607853442","resolution":{"observed_at":"2026-08-11T16:38:24.378034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T16:38:23.170289Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.170289Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:2e4f1f0bed899af50ba1e70e702dca6b1f46c1e3608d3c22229fcb94ae6555f2","observation_id":"6a00835a-f980-4756-a9df-70f5f278827b","resolution":{"observed_at":"2026-08-11T16:38:23.170289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.359341Z","title":"Vision-based freezing of gait detection with anatomic patch based representation","venue":null,"work_id":"390b27f0-218a-46fc-9a9d-8fc7a3e09a49","year":2018},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.175362Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:06053a4bca1a8ed72130e12144711f5c97ffc371960459819acc03701b427ef2","observation_id":"858c5d64-c8a9-495f-be26-980af22e3251","resolution":{"observed_at":"2026-08-11T16:38:24.363992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.344007Z","title":"GQA: A New Dataset for Real-World Visual Eeasoning and Compositional Question Answering","venue":null,"work_id":"35686233-1367-4008-a22a-bb4eb6762a5c","year":2019},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.179941Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:da81008bb485aee3b52f55a238f6efc417c4435b07e72c9bc9bf1b34ab912ad5","observation_id":"5b56b643-4a71-4cfc-9c8a-74f0e0f86360","resolution":{"observed_at":"2026-08-11T16:38:24.349286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05736","last_updated":"2023-12-06T17:02:25Z","snapshot_observed_at":"2026-08-13T05:53:52.455716Z","submitted_at":"2023-10-09T14:10:21Z","title":"LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05736","snapshot_observed_at":"2026-08-11T16:38:23.184668Z","title":"LLMlingua: Compressing Prompts for Accel- erated Inference of Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.184668Z"},"links":{"cited_paper":"/paper/2310.05736","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:2a8fa8748cffa97e4179c8703b098f82d06c98aba86348f0e0bf658acb94cf63","observation_id":"7794ffa5-db67-469b-b98c-b57fb734b362","resolution":{"observed_at":"2026-08-11T16:38:23.184668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.328979Z","title":"Chat-univi: Unified Visual Representation Em- powers Large Language Models with Image and Video Un- derstanding","venue":null,"work_id":"97162a31-c04e-443f-befb-e467238060a6","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.189447Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:b9829b02aab92e7a3fc8f47aaa5ef41dd69416010e76a3d24291dcc0538618ba","observation_id":"d3431e70-d808-426f-8882-589bf490cab8","resolution":{"observed_at":"2026-08-11T16:38:24.334087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.314621Z","title":"ReferItGame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"6fa45b7d-7575-4e7e-9459-d60074ce3722","year":2014},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.193513Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:d7d4e9ded1f056871ece060bf9574f95f4cfd02026dbf6837127a18b1f922099","observation_id":"e95e7ffa-4f76-4850-ac58-5a023780b521","resolution":{"observed_at":"2026-08-11T16:38:24.319453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.299525Z","title":"Shamma, Michael S","venue":null,"work_id":"9ca1e87d-cae8-486d-8f9e-5989e1e93a68","year":2016},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.197464Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:81302122c8f1dd61df401019cead51202893e9e4f068976327127965a1949bf5","observation_id":"050cfcae-719a-4d2b-aa14-f9261a73546f","resolution":{"observed_at":"2026-08-11T16:38:24.303994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T16:38:23.201279Z","title":"Seed-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.201279Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:4a788af2edb440f3da73f9ddff1f16f3fb429486d43985f233d5a6ba59d9c3d5","observation_id":"68eec932-30cf-47ef-bfd9-ffb94fc0e74a","resolution":{"observed_at":"2026-08-11T16:38:23.201279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.284613Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":"94ceae41-a2e7-4265-ad63-17b72abdc6e0","year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.205522Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:c414095d5d7656f31103b7b92950544df9696f6e226563d83a5f7c805e803b60","observation_id":"988303e2-7d51-4828-bbcf-77e5927944d9","resolution":{"observed_at":"2026-08-11T16:38:24.289534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.268615Z","title":"MVBench: A Comprehensive Multi-Modal Video Under- standing Benchmark","venue":null,"work_id":"6d3c05b3-8699-4d20-bf62-8cc52ba00379","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.209832Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:1b65aafe2f84c0cb6fc0cefd4d68f5965ac35ec0473381b23cee1076607e6c3c","observation_id":"06f1b6c1-cfe4-4fcd-b12b-9167853b30d2","resolution":{"observed_at":"2026-08-11T16:38:24.274403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.253255Z","title":"VidToMe: Video Token Merging for Zero-Shot Video Edit- ing","venue":null,"work_id":"cf535bda-a531-424f-ba31-4098d2dcad71","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.213617Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:279b0de85f6d6a7039de9bbae354c37e464125730a83940f044348df4c73d5f2","observation_id":"518762f7-23b3-4235-92d4-4c1344c7aecb","resolution":{"observed_at":"2026-08-11T16:38:24.258141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.237778Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":null,"work_id":"dd2e84a1-c891-4582-b371-84b60a6248b7","year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.217336Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:f1e3c6799236972b35d0c657e1d57f1d52d31bc4f72b08453a9399d26a1ae50d","observation_id":"51dd0415-e64e-4783-9a9e-fda1710687c5","resolution":{"observed_at":"2026-08-11T16:38:24.242917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.222549Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","venue":null,"work_id":"c4a0d473-7299-438a-ba83-c50973ad29bf","year":2025},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.222025Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:7c20c784a510c2b4d3fd33d3b0aff4fd9eac4d29b409c2419770f0621e7587ad","observation_id":"92a16398-b545-44e4-8979-57ae413ca2be","resolution":{"observed_at":"2026-08-11T16:38:24.227794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T16:38:23.226456Z","title":"Video-LLaV A: Learning United Visual Repre- sentation by Alignment Before Projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.226456Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:26abeb13524fafa091911825d2a2edb37d8c959c45dfcefcb68e9eb5e66cb36d","observation_id":"2e3f976d-c981-44d5-a858-17164d855aee","resolution":{"observed_at":"2026-08-11T16:38:23.226456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.208481Z","title":"VILA: On Pre-training for Vi- sual Language Models","venue":null,"work_id":"2583e9eb-8648-4268-a3bb-21e8bcfc4d9c","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.232050Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:1e27b1c37d1f29801e8bf112af2c49e37e61a6f3f1135c5140fbfe6db39779cc","observation_id":"3f5c0778-e792-4e59-8a65-efc0971f955e","resolution":{"observed_at":"2026-08-11T16:38:24.212782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.195940Z","title":"Visual Instruction Tuning","venue":null,"work_id":"642ad627-4707-4c43-aecf-e51c8022d7cc","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.237633Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:4abb5d9b84127e6e4c11126862a3dd9988c0416c795d933dd31dca1c6346cf19","observation_id":"32ebfc29-6c55-4996-aae1-a76ca8583fbc","resolution":{"observed_at":"2026-08-11T16:38:24.199799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.181533Z","title":"MMBench: Is Your Multi-Modal Model an All-Around Player? In ECCV, pages 216–233","venue":null,"work_id":"69e66033-186e-478e-ae5d-a680f16ae52f","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.242415Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:a77d93c516eaf4a2650573c3d34a125959c7abdb1f99d996d221806efd6c20c4","observation_id":"07d0d442-44ae-4980-a08c-383de4b60c55","resolution":{"observed_at":"2026-08-11T16:38:24.186301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T16:38:23.247628Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.247628Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:f22bc1b1d9adafb204a2d39b552f16334ae6818013fbbb3e2f4be6942028154a","observation_id":"7a9a20a6-08bb-4b17-9cb3-637fd6a280f8","resolution":{"observed_at":"2026-08-11T16:38:23.247628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.167149Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","venue":null,"work_id":"216d8cbb-e13f-4b6d-ae62-d290992b77bf","year":2022},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.252816Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:0a4fa300b9058bfdeaa7d6e93e359cb2242fad0287e019fe75d6d657d5b59a2b","observation_id":"7e65f279-9a63-403a-824c-3ac0e044ba28","resolution":{"observed_at":"2026-08-11T16:38:24.171875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.151305Z","title":"Autoregressive omni-aware outpainting for open- vocabulary 360-degree image generation","venue":null,"work_id":"7c924734-7c5a-4426-a20b-edda58a52661","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.257615Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:7e8e5b9d28b9c1b9bc4226b4b0089e4ba11dc786f19cb75fb8de1c5e454905de","observation_id":"548e78ee-8e54-4b6a-8702-cc6a77bc6639","resolution":{"observed_at":"2026-08-11T16:38:24.156331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T19:40:57.491981Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-11T16:38:23.262723Z","title":"Valley: Video Assistant with Large Language Model Enhanced Ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.262723Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:6aaa989c04b843512d6290cfa7e4db2be2511a6826b0c537155a981b4975a76f","observation_id":"e4ff90b6-9572-4e9e-bb04-3ebbee2a1dcc","resolution":{"observed_at":"2026-08-11T16:38:23.262723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.136864Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Mod- els","venue":null,"work_id":"a70c6821-0c15-4100-ad77-fa2cbde8b95f","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.267826Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:9a97b15c0df9b4eef7018b6d55290a19d2a50bfba00e473919c5db28f1182d8a","observation_id":"f691b681-a29b-4662-b668-5adb143c233a","resolution":{"observed_at":"2026-08-11T16:38:24.141744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.121729Z","title":"Egoschema: A Diagnostic Benchmark for Bery Long-Form Video Language Understanding","venue":null,"work_id":"dbe788bf-7e0b-41cd-85ff-3e799e9e0e36","year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.273657Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:35e81e3da2d8a0fade214a66dce6e3e9470b070121d34bc23f994c2076ce8915","observation_id":"1380e099-43ab-480b-8e23-5aa7f9838e04","resolution":{"observed_at":"2026-08-11T16:38:24.126565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.106291Z","title":"Generation and comprehension of unambiguous object descriptions, 2016","venue":null,"work_id":"9e0b5ce4-9d4a-4b82-a984-96bf640f5b00","year":2016},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.278963Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:3372ffbc2fe6ea94ee52acbc6e4007f0ac61e34c3f32ff6948452e9c28eb0135","observation_id":"ddd3961b-6767-4666-8164-aac1912eaec5","resolution":{"observed_at":"2026-08-11T16:38:24.111537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.091852Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"31b2607e-a8a0-40b1-873b-70563bbf4ca5","year":2019},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.284075Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:114e2719af761da8151f9f03e804c560e471172112a425a49078a10af977c1d1","observation_id":"185ae4d6-ef84-462f-a676-5b1346e15f11","resolution":{"observed_at":"2026-08-11T16:38:24.096536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.076427Z","title":"Perception Test: A Diagnostic Benchmark for Multimodal Video Models","venue":null,"work_id":"30e8ac52-7367-4177-8e38-448d9530c7d2","year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.289095Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:495d297a907f5c2a27f7017d3ca80644a3bdbcb66155a5df74e3c7e9f514ebab","observation_id":"0ae5b099-655e-46a9-b95f-99c036a5e7cf","resolution":{"observed_at":"2026-08-11T16:38:24.082201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.060685Z","title":"Learning Transferable Visual Models from Natural Language Supervi- sion","venue":null,"work_id":"905713ea-950a-491a-ad84-6a01ee74b2ed","year":2021},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.294097Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:4e87219711428ea457d067c4253f9351dc4747a78e182da2e13032b9bb568824","observation_id":"f9c5f32d-f17c-4c41-a43f-f69bcfcbb382","resolution":{"observed_at":"2026-08-11T16:38:24.065917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.044725Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge, 2022","venue":null,"work_id":"6550d13c-08b1-42a9-a369-73ccb18c5ebc","year":2022},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.298810Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:59872c2d0df3155d74a76f28e18af630c396a46a9cc49aa65933e61da833a335","observation_id":"f605098e-75ae-43b5-9fdf-74ae1e73dc5b","resolution":{"observed_at":"2026-08-11T16:38:24.050404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.303588Z","title":"Llava-prumerge: Adaptive Token Reduction for Efficient Large Multimodal Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.303588Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:4dfb52e74cae291738ed8a803b780f8cd9617865fdd53d701e360b98968ab28e","observation_id":"f567e276-c483-4e2b-ac6b-118259650460","resolution":{"observed_at":"2026-08-11T16:38:23.303588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.030305Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"e6dcc7b9-2b0b-4aea-a1a8-3389535002a9","year":2018},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.308314Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:005bbc90089ae57bc44076281fbdc4b37464d95f1d87374dd1156ecee11690aa","observation_id":"b534e526-2aa0-4464-8f86-c197afa5c564","resolution":{"observed_at":"2026-08-11T16:38:24.034898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.016171Z","title":"TextCaps: a Dataset for Image Captioning with Reading Comprehension, 2020","venue":null,"work_id":"742471d7-d895-4a44-b716-1954493c90bf","year":2020},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.312965Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:9fd213ea50eca74b42b1be24eae702235a9135f24520f38e5af483f3bf630c63","observation_id":"0203478c-b5fc-41e7-a016-a25cda20fc82","resolution":{"observed_at":"2026-08-11T16:38:24.020566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:24.002384Z","title":"Towards VQA Models That Can Read","venue":null,"work_id":"fa0eb8d1-48eb-44e8-9008-ca5380fef0e3","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.317610Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:bc16dd617b653e7b415c53973ff59105f52fa7e68e042076246aeed7c3782751","observation_id":"be74fcc7-6dc7-4e10-a015-78bf9100fdce","resolution":{"observed_at":"2026-08-11T16:38:24.006513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.986587Z","title":"Moviechat: From Dense To- ken to Sparse Memory for Long Video Understanding","venue":null,"work_id":"b4202e17-c94a-47ed-834a-10363a6cf7b9","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.322443Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:0b5b3ab121a37801d13d919f900ad67e6cb71531d1d9e6136ad8fa0dffb102fa","observation_id":"4c438198-f11a-4cd1-a214-35405fb7ca7a","resolution":{"observed_at":"2026-08-11T16:38:23.992233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T16:38:23.326515Z","title":"LLaMA 2: Open Foundation and Fine-tuned Chat Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.326515Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:895590c6bd25974f6409dc80d4148c5120cc117d84085a3d2f723f5e2d8b57b9","observation_id":"2d20aec9-ae63-4483-a3d9-132da3fc07ce","resolution":{"observed_at":"2026-08-11T16:38:23.326515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-12T04:14:49.076577Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05819","snapshot_observed_at":"2026-08-11T16:38:23.330686Z","title":"[cls] token tells everything needed for training-free efficient mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.330686Z"},"links":{"cited_paper":"/paper/2412.05819","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:7d3c1cb7f05d20fd5efa138725eca5a4c2df09ac1e515ce77c2fa360c00e69f9","observation_id":"927d1f5a-eb39-4d25-a0d6-5dd9d7e7c996","resolution":{"observed_at":"2026-08-11T16:38:23.330686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.969952Z","title":"VisionLLM: Large Language Model is Also An Open-ended Decoder for Vision-Centric Tasks","venue":null,"work_id":"9cdebc3b-7b5f-4671-912a-53e945729e4d","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.334738Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:58663742ad14ada9d6c889f2dbb537c9c3079f27994c4ebb9cbf21184730f60a","observation_id":"a58606c6-b27b-4f42-bc8c-f950dcfea81b","resolution":{"observed_at":"2026-08-11T16:38:23.975446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.954309Z","title":"LongVLM: Efficient Long Video Under- standing Via Large Language Models","venue":null,"work_id":"59d7e417-8b25-4082-a6da-2fe98046f9b6","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.338794Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:14346c4832b92d64617ef22081a61c3b70b057c188dd981578b0367fd93a2fee","observation_id":"40d9be43-8b8c-4ab3-b5f0-119fd11e7d43","resolution":{"observed_at":"2026-08-11T16:38:23.959253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.924087Z","title":"Video Question Answer- ing via Gradually Refined Attention over Appearance and Motion","venue":null,"work_id":"27e65d76-19fe-4392-aaa1-3229ef421dbe","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.346774Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:d90481a3a213eea9234a950d99119e90c131482b7a4cbbe258abf69c4fa52eb1","observation_id":"e7dd3e38-dc97-4301-ab75-fa784b31980b","resolution":{"observed_at":"2026-08-11T16:38:23.928832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T16:38:23.351205Z","title":"Qwen2 Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.351205Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:7ad8c4582644e2f8ff587a537556fd156f0c699d8013fe87780dd707e10c817c","observation_id":"ad4deac9-1809-4d49-8119-ad02323728de","resolution":{"observed_at":"2026-08-11T16:38:23.351205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14481","last_updated":"2024-03-23T03:13:35Z","snapshot_observed_at":"2026-08-13T04:55:31.898091Z","submitted_at":"2023-12-22T07:17:51Z","title":"SurgicalPart-SAM: Part-to-Whole Collaborative Prompting for Surgical Instrument Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14481","snapshot_observed_at":"2026-08-11T16:38:23.355997Z","title":"Surgicalpart- sam: Part-to-whole collaborative prompting for surgical in- strument segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.355997Z"},"links":{"cited_paper":"/paper/2312.14481","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:a170bcd216d3fdb4aa166fc25689722998f4ecb8e64f1f208e8307c5beb05bcd","observation_id":"1440bf94-3c60-4b0a-a6ba-06e2acd78b34","resolution":{"observed_at":"2026-08-11T16:38:23.355997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-11T16:38:23.360911Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.360911Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:67b00dbc22041f8d5e6439f0915fa5e09a07084bffd526f01c808fa03f528e76","observation_id":"8bf437b6-282a-4b7d-9fd5-9bfd9b010e8e","resolution":{"observed_at":"2026-08-11T16:38:23.360911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.909617Z","title":"LLaV A-NeXT: A Strong Zero-shot Video Understanding Model, 2024","venue":null,"work_id":"d9243704-696b-4a83-bf06-67df123fed5d","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.365795Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:b54e64dde15d4a1b2f0ac790ab514eda30818e7646b8ccb944d41893a8d6cfce","observation_id":"de2b71cb-7949-42ce-9489-ce89004ba5e7","resolution":{"observed_at":"2026-08-11T16:38:23.914436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.892795Z","title":"Needle In A Video Haystack: A Scalable Syn- thetic Framework for Benchmarking Video MLLMs","venue":null,"work_id":"8b57ee4c-ac64-4f9f-8108-4719f5090238","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.370070Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:4f5faa31f4f90d58b23bf746ec001fabfd2cafc080743b1feaf43b76cc54c1df","observation_id":"2e7fbe65-0514-494c-b5a9-b5f9956e60c7","resolution":{"observed_at":"2026-08-11T16:38:23.897803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.875419Z","title":"Clip in medical imaging: A survey","venue":null,"work_id":"d70861db-14ea-49b8-9d03-ca3e98d36946","year":2025},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.374598Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:ca0f0dd66a5e7044cf04505686996c34d40979ae9993e42d1f0c166261631910","observation_id":"1d57da18-8074-49fb-bc71-4fbfdcd2012d","resolution":{"observed_at":"2026-08-11T16:38:23.880456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-11T16:38:23.379009Z","title":"Languagebind: Extending Video-Language Pre- training to N-modality by Language-Based Semantic Align- ment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.379009Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:f0ed30bc545739201680e98a72ad30aab6277454cdbc35ae538129438b628542","observation_id":"4e9f2669-99f0-4716-809f-fdfd699558a7","resolution":{"observed_at":"2026-08-11T16:38:23.379009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.859683Z","title":"A closer look at the cls token for cross-domain few-shot learning","venue":null,"work_id":"8893b0dc-12f1-4485-a3b4-44c7cc16e0b0","year":2024},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.383842Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:99d9bf34a50f89a2a1b1183ec492969b437597d69cf6ba4e49974e16f7a14c2f","observation_id":"4f8d223f-0972-4550-9f92-406505997ab6","resolution":{"observed_at":"2026-08-11T16:38:23.864704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.844419Z","title":"Training Details We adopt a two-stage training strategy [9, 30, 33], dividing training into pretraining for modality alignment and fine- tuning for instruction tuning","venue":null,"work_id":"1eaf53a4-5af5-4cd4-b79a-e77d616f109a","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.388255Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:aabb85b3145a8ba0a612f67703b194f25e61170e2b6e3d8416b1fa3f7c9cc2f1","observation_id":"1a170a45-5858-417e-ad21-d9e763a9e8ce","resolution":{"observed_at":"2026-08-11T16:38:23.849232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.829446Z","title":"Additional Discussion on Different Frame Se- lection Features","venue":null,"work_id":"1cdad079-fe2d-46bf-a941-26638bebc92b","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.392641Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:a7b3a99d6c32c7db8cc76c24d4694869ae528a31378322cf1d56c11989fb1018","observation_id":"be9a685a-eca2-48a4-a5dc-bca19ff2bb72","resolution":{"observed_at":"2026-08-11T16:38:23.834550Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.811503Z","title":"Game Science","venue":null,"work_id":"e47ed3e5-708e-4315-ba9a-fd9a91bb824a","year":null},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.397829Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:8b426fb84bec5daf0e088bb81860f98f7adfeb9a7e8d25229aca877f24e37951","observation_id":"f95bd0b0-8aba-4b16-b736-e932672b0924","resolution":{"observed_at":"2026-08-11T16:38:23.817966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:38:23.938813Z","title":null,"venue":null,"work_id":"173d3665-b460-4f27-aa33-d65e13d42e66","year":2025},"citing_paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens","version":2},"reference_index":470,"source":"pdf_text","source_observed_at":"2026-08-11T16:38:23.343023Z"},"links":{"citing_paper":"/paper/2412.09919"},"observation_digest":"sha256:4e50b066e31fcdd02e28ce09dc09d3463496fa1c57a883317b45aff95ef793fe","observation_id":"3039831d-a05b-48b2-935a-8e8423126b96","resolution":{"observed_at":"2026-08-11T16:38:23.943843Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.09919","last_updated":"2025-08-11T14:40:50Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T04:14:57.805525Z","submitted_at":"2024-12-13T07:13:40Z","title":"B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":19,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2412.09919."}