{"as_of":"2026-08-07T10:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:307d3342e1b59e07911f25f94dde65f6798efc26cdcef148e1e4a7b6f55e9501","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:40:40.564012Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T06:16:07.090870Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T08:16:47.773102Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"cited_work":{"arxiv_id":"2508.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19650","snapshot_observed_at":"2026-07-02T08:16:47.773102Z","title":"Video-levelgauge: Inves- tigating contextual positional bias in large video language models","venue":null,"work_id":"ecad2dfa-cb2e-49be-b05c-665143e1967b","year":2025},"citing_paper":{"arxiv_id":"2605.19322","last_updated":"2026-05-19T04:02:01Z","snapshot_observed_at":"2026-08-02T06:11:11.606278Z","submitted_at":"2026-05-19T04:02:01Z","title":"DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T06:55:01.619441Z"},"links":{"cited_paper":"/paper/2508.19650","citing_paper":"/paper/2605.19322"},"observation_digest":"sha256:10d4b16ae36f391f34754d5bdb87dbedb134dd341b68f106c8388dd380e5ca65","observation_id":"1bfb9d1e-a881-429b-9703-92f7ff47c0af","resolution":{"observed_at":"2026-05-20T06:58:05.983666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"cited_work":{"arxiv_id":"2508.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19650","snapshot_observed_at":"2026-07-02T08:16:47.773102Z","title":"Video-levelgauge: Inves- tigating contextual positional bias in large video language models","venue":null,"work_id":"ecad2dfa-cb2e-49be-b05c-665143e1967b","year":2025},"citing_paper":{"arxiv_id":"2606.05008","last_updated":"2026-06-03T15:28:57Z","snapshot_observed_at":"2026-08-06T07:23:12.183499Z","submitted_at":"2026-06-03T15:28:57Z","title":"M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T06:16:07.090870Z"},"links":{"cited_paper":"/paper/2508.19650","citing_paper":"/paper/2606.05008"},"observation_digest":"sha256:074191bf3d4816e83560c87384ee42821b2e96624b8eda7c13e0f7d5ded38800","observation_id":"d29541e9-3524-4b6a-a74a-0cb96578d36d","resolution":{"observed_at":"2026-07-02T08:16:47.774503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.19650/citation-record","integrity":"/paper/2508.19650/integrity","json":"/paper/2508.19650/citation-record.json","paper":"/paper/2508.19650"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-05T15:40:40.375797Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.375797Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:4b9f8e2d0c52af85af7b7e3aad6de8c9732d0de733a84db88f6d5298433fe953","observation_id":"65e74ff3-ca57-4317-b64b-72922a10f5e6","resolution":{"observed_at":"2026-08-05T15:40:40.375797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.321303Z","title":null,"venue":null,"work_id":"397505bb-8b49-4ec3-a599-f07acd6f3c90","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.379826Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:2e1f1fb55dea3cb50739cefe1fbc51e4046ce1c7193bd326cec0f956562843ef","observation_id":"b145b217-8f77-4661-b58a-012bfb679beb","resolution":{"observed_at":"2026-08-05T15:40:41.324211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.312731Z","title":"Claude-sonnet-4","venue":null,"work_id":"adb839d4-0376-4823-9474-1cf078df4dfd","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.382974Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:0fa42d68bff037b3481a388a24a4e8c5a8d6c04d226a58d0f83703f2d818ab57","observation_id":"37c1ab81-66d2-4275-8218-f814e6f8b074","resolution":{"observed_at":"2026-08-05T15:40:41.315764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.303412Z","title":"Minigpt4-video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens,","venue":null,"work_id":"ca032ef4-4ea8-4ef2-962d-44bbc421ff89","year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.386685Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:3222070fb5bd40dee41f8d18f234e9d5dc0cf57da56acf51f91aba145f02c590","observation_id":"5689d440-2051-4c0b-bc89-e1e4b1c65b74","resolution":{"observed_at":"2026-08-05T15:40:41.306761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.294390Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond, 2023","venue":null,"work_id":"21200064-d011-4268-9d80-f60c95cded98","year":2023},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.389989Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:b7c54257b90ad927794f4717b39ff2615b88ac97d0e4337d33f78ec4a1cf54c7","observation_id":"2bece409-1543-4315-8abb-85aba8fc7f43","resolution":{"observed_at":"2026-08-05T15:40:41.297697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T15:40:40.393101Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.393101Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:7826882385518b180368b714c2cfb4323f83208d318edf7f529113fea580369f","observation_id":"059fc12a-ced7-4d08-af87-903701ead891","resolution":{"observed_at":"2026-08-05T15:40:40.393101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.285587Z","title":"Doubao-seed-1.6","venue":null,"work_id":"8e83d98b-1d92-4a13-871f-0e046491b1f7","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.396513Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:ff7e5768c714c7444052f8bb77b4ac48e031190f81c41e22d73595442f37c488","observation_id":"c353df1a-85d1-4771-aa1b-1739b7ecfa43","resolution":{"observed_at":"2026-08-05T15:40:41.288645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.276707Z","title":null,"venue":null,"work_id":"8cb38a33-ada6-4441-9c9f-15573165e634","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.399914Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:2462b896ffc0283ec34e2b14be0a93a23824e1ba7b0cbce9960f3b3f357cbd27","observation_id":"8b13b3b2-8aa9-48d4-a1ed-33d456936220","resolution":{"observed_at":"2026-08-05T15:40:41.279774Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.267189Z","title":"LongVILA: Scaling long-context visual language models for long videos","venue":null,"work_id":"739dd074-d828-480a-94de-f5d34422d7bd","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.402904Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:3639098ab161b2d0e34228952180922caaeae3f93260c921a2786e6ff935ca77","observation_id":"ce52ab39-d687-408f-801d-df85a4ecd06c","resolution":{"observed_at":"2026-08-05T15:40:41.270684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.257449Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video- llms, 2024","venue":null,"work_id":"8b547e8f-44c2-41a6-91f0-e61e856b712a","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.405886Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:a9d4116638140e29258c27313719fa185a47c5bfa152d579727084f0dde1fc64","observation_id":"1b2fed83-7c48-4c90-bd44-ae8aa70838ac","resolution":{"observed_at":"2026-08-05T15:40:41.260969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.248414Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic ca- pabilities, 2025","venue":null,"work_id":"a5c2c4f2-9a53-4c14-bb94-8d3157e9fcb9","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.408752Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:a5994f001b4d14fecbdcd5155cc83ca78a60c8a09b1a7dd6a37678ad3f7c5e04","observation_id":"9d43fce6-8ccf-46cc-b5e3-cc9bff5c269d","resolution":{"observed_at":"2026-08-05T15:40:41.251670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.239230Z","title":"Video- mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"749b93bd-2c3b-40c5-8ea8-80c9d527e5f9","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.411871Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:bd764a5b450d92b7ebc26ee238959a9626917e8e4269967f331c2b8d261ee489","observation_id":"f5ab3313-f21c-47f7-864e-7f20a81a650e","resolution":{"observed_at":"2026-08-05T15:40:41.242533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.229999Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"29c971f4-eb59-4a17-9a9e-2c98b11a5e62","year":2022},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.414832Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:9d8fcc7c70d24f582cd89ba3896a9042689627e7aec29873351c87be0d05a3f9","observation_id":"ea51068d-30b1-43a7-97ad-ad4c47deb42d","resolution":{"observed_at":"2026-08-05T15:40:41.233387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.220828Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"b6a7e68e-0ef5-49b1-b1dc-ddbd3cbeab79","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.417531Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:77f25c876261c95e1a8dd301b83595eeea57b0a43828260b7a658bcb64a1a4cd","observation_id":"00566207-44b0-4dc9-9499-bec7e5bbe829","resolution":{"observed_at":"2026-08-05T15:40:41.224035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T15:40:40.420423Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.420423Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:4452d3755c07ccc47f85822636b57409c7ee4f1e635ba7255feaf6295c89d212","observation_id":"2307a43e-3c88-4356-b064-ede6b14e023f","resolution":{"observed_at":"2026-08-05T15:40:40.420423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.423571Z","title":"Rush, Douwe Kiela, Matthieu Cord, and Victor Sanh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.423571Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:2103c35428a486945b64236f1600d908c13b18c398a7496129eb9e692b8afbd6","observation_id":"b9dc044b-cff9-4370-b2ce-6b458c9ccfb6","resolution":{"observed_at":"2026-08-05T15:40:40.423571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.206481Z","title":"LLaV A-onevision: Easy visual task transfer","venue":null,"work_id":"6c9f6b4c-6dc8-42f1-ad06-daa5cfecc3d7","year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.426686Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:63f03e5c605c94c5c1d169c1f20de9852c34ef0d177c39541bb3b9708530658f","observation_id":"1f10baab-a03f-448b-bc7f-5ebb11321d01","resolution":{"observed_at":"2026-08-05T15:40:41.209634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.198102Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"b7675063-5c7a-45db-9dc9-8733305e24e4","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.429618Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:2c5e4f8260b9a560f92c1dabefc4fe6d3f7b209ec05c07856ac237203a1c5e1f","observation_id":"dbb12601-14cf-4791-b2e6-2e166ac5db85","resolution":{"observed_at":"2026-08-05T15:40:41.201130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.188936Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"74b82d9a-bca8-40c4-9f8f-bd5a5c046cdf","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.432539Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:77e0aa60ff70fadc2941cd726c2053b9adb01e340495168284f07871f6648d7a","observation_id":"1fc36da3-17db-4a3c-826c-a94a1c94c0bd","resolution":{"observed_at":"2026-08-05T15:40:41.192619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.180305Z","title":"Video-LLaV A: Learning united visual rep- 9 resentation by alignment before projection","venue":null,"work_id":"9f703f53-517a-4e17-8afc-6dc6f425e9ef","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.435609Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:85860d29c3974ce43776f74be90189b5c55bf4d3d3e4f963406d9caeff3d93d3","observation_id":"a871293f-60e7-4828-a97a-939032e264de","resolution":{"observed_at":"2026-08-05T15:40:41.183525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-07-06T19:06:54.428910Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-05T15:40:40.438516Z","title":"Kangaroo: A powerful video-language model supporting long-context video input","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.438516Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:e42adbe1fc4088c46b99b6ebb21523f8e016666de2f9c202d0f0ec2e6d69f189","observation_id":"adce1126-a8a0-4236-b4ca-617e4f826596","resolution":{"observed_at":"2026-08-05T15:40:40.438516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.171547Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":"706a336e-46d6-488b-ba4f-cbe128620848","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.441934Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:5471357cb949f2c22975259818f511e8db7f6d5db6ea9af3ffefeac9b843d54c","observation_id":"38c45cc1-d510-49ce-b333-a65a322c07fd","resolution":{"observed_at":"2026-08-05T15:40:41.174770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.162430Z","title":"Scaling laws of rope-based extrapola- tion, 2024","venue":null,"work_id":"df2a9486-175d-4339-a36f-3afb91aaf9b1","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.445184Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:41469f761969ef7f813e551f8a51b3caabb9852801bf882c562e13af79cbc31f","observation_id":"af6c663a-86dd-4ae8-b784-9963b6deba10","resolution":{"observed_at":"2026-08-05T15:40:41.165563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.153188Z","title":"TempCom- pass: Do video LLMs really understand videos? In Findings of the Association for Computational Linguistics: ACL 2024, pages 8731–8772, Bangkok, Thailand, 2024","venue":null,"work_id":"d7756937-df45-4a43-a4f0-be2fbb6748fa","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.448237Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:ef9bdd41f0549f5afe410348b12981fe73140884a2a803480f51c39a7690c73f","observation_id":"6753fc71-50bc-4a1c-9b66-c935817c839c","resolution":{"observed_at":"2026-08-05T15:40:41.156567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.144386Z","title":"Nvila: Efficient frontier visual lan- guage models","venue":null,"work_id":"5a7a5fce-8ee9-4065-8b74-1b0d91da6cff","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.451552Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:75b77c0dadfbcecab7a9f64a21721928452b5a51d9df5f54aaf3d79d6d8243ca","observation_id":"d7681b96-e8d3-4c04-88e3-5b215a9226eb","resolution":{"observed_at":"2026-08-05T15:40:41.147633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.134761Z","title":"Nee- dle in a video haystack: A scalable synthetic evaluator for video mllms","venue":null,"work_id":"81c07a08-6234-464d-9174-7ca767185e9f","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.454556Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:99f2fc520fb1b674effed5134aa1a8aa580d56016bb2314b43f0295f38923752","observation_id":"a0edd6fb-bef5-477d-9122-9dd90f9cbd0e","resolution":{"observed_at":"2026-08-05T15:40:41.138613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.125241Z","title":"Video-chatgpt: Towards detailed video un- derstanding via large vision and language models","venue":null,"work_id":"17182010-bedd-4e1e-98e9-150837ec8e94","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.457639Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:fbb2698a2726303de6123b5533788b238ef30aa670dc7689f03f3308a6beba9a","observation_id":"dbd00143-8289-4c02-8ecb-57b2ec42e662","resolution":{"observed_at":"2026-08-05T15:40:41.128830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.115297Z","title":"The serial position effect of free recall","venue":null,"work_id":"ac1c69bc-0b18-4636-b669-69edc992b3a1","year":1962},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.460901Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:f250015ce585148a1d402737466d5bb78be53336337a72b6492b80f20646c1da","observation_id":"b27ab64c-bbdf-4ef0-90ff-b9379f5b0262","resolution":{"observed_at":"2026-08-05T15:40:41.118795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01437","last_updated":"2024-07-12T17:20:34Z","snapshot_observed_at":"2026-08-04T09:35:53.028512Z","submitted_at":"2024-07-01T16:32:16Z","title":"Needle in the Haystack for Memory Based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01437","snapshot_observed_at":"2026-08-05T15:40:40.464235Z","title":"Needle in the haystack for memory based large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.464235Z"},"links":{"cited_paper":"/paper/2407.01437","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:de120540ff9023c7f564956ab0015a35b884addcdeda951d073353a637928937","observation_id":"ab257ea7-ec9f-4d31-9354-ee63024834ad","resolution":{"observed_at":"2026-08-05T15:40:40.464235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.106247Z","title":null,"venue":null,"work_id":"620732d4-f33d-4843-b4f0-778b363c4038","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.467639Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:8941ff76c12b2a1398693c6a5256b7d8801514ed8f54d27aca9ec31f88a62307","observation_id":"d8901391-803d-4ff6-b76f-753967c912c4","resolution":{"observed_at":"2026-08-05T15:40:41.109398Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.097187Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":"0ecdd599-4f98-43a1-8d74-d0cf944fbbf1","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.470740Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:a1b204f67b260eda390c06801b95607ee0f42c15fd2b19c02198aa3f8b93d36c","observation_id":"9c773163-96be-4efa-9531-554b984c2f0e","resolution":{"observed_at":"2026-08-05T15:40:41.100555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.087709Z","title":"Too many frames, not all useful: Efficient strategies for long- form video QA","venue":null,"work_id":"165b1461-bcf8-4db6-b04b-45c93a1f375b","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.473979Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:400541c8dfd57edcd8d41ebde02a429c933e009a825bbfe6858fbbda19ec08da","observation_id":"4605b57d-522c-4e9d-b7b3-845e14079c8b","resolution":{"observed_at":"2026-08-05T15:40:41.091034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-06T23:04:53.910156Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-05T15:40:40.477147Z","title":"Video-xl-2: Towards very long-video under- standing through task-aware kv sparsification.arXiv preprint arXiv:2506.19225, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.477147Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:3a00f68c1d5a65ed64927631095fc69855034c43a82f1032c87b8cec761a0d9d","observation_id":"bb56a904-e9af-4aa6-bde5-e33822a78dcd","resolution":{"observed_at":"2026-08-05T15:40:40.477147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.078495Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding, 2024","venue":null,"work_id":"f3f9184f-705d-42be-8d4f-3834e043f432","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.480593Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:e7fd5702d42ed61497fe0b304402ec8346f34829cab581dad60c4b123e8c716c","observation_id":"09913029-dae3-4a30-9500-59136aa2bbb5","resolution":{"observed_at":"2026-08-05T15:40:41.081785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.483719Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.483719Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:8985a9d9021a7c8efdc680b310fd5d3deff2f4ff87e7b8628672f408ee7b097e","observation_id":"e6cce75b-3f48-4e2e-aa07-a121e0e2311c","resolution":{"observed_at":"2026-08-05T15:40:40.483719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.062280Z","title":"Real-world anomaly detection in surveillance videos","venue":null,"work_id":"46eafa33-92f9-48ce-a2e6-a8bd9e1c4ee8","year":2018},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.487027Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:3e53a918f8ed4788edcbc839fb65a6fbf3e2d4619a3f2c31d786d63563a88fa0","observation_id":"99f41bf0-272c-438f-aee6-58fabe8059a7","resolution":{"observed_at":"2026-08-05T15:40:41.065754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.051852Z","title":"Mimo-vl technical report, 2025","venue":null,"work_id":"b2577f96-4252-4ebc-a921-03c17c188058","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.490189Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:077ede1197fd486180cb395e596afa68ec909475c962cc994f32c8e3d22f9223","observation_id":"d376f8ca-6071-4fce-ae16-dbcbd90f2658","resolution":{"observed_at":"2026-08-05T15:40:41.055225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.041509Z","title":"Glm-4.5v and glm-4.1v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning, 2025","venue":null,"work_id":"7761d33f-87d4-4868-836c-ad49d74ff810","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.493475Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:66d3e327201c79d06cd75161e4c777c3ff47ca16e35180a4e7a1a4977656a17d","observation_id":"e1c435f9-c960-4abd-ac46-0f9a93d2e30d","resolution":{"observed_at":"2026-08-05T15:40:41.045168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.031227Z","title":"Multimodal needle in a haystack: Benchmarking long-context capability of multimodal large language models","venue":null,"work_id":"bf1cf9a3-0bbd-4511-9509-481560f1401f","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.496721Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:55bb42b4d32a26df31a16add41e295ae55b7b9d6750862ea9b9dd54d812ba965","observation_id":"5170d3ad-81ff-486e-9603-2d99133f9c50","resolution":{"observed_at":"2026-08-05T15:40:41.034671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.021039Z","title":"Lvbench: An extreme long video understanding benchmark, 2024","venue":null,"work_id":"63ee2c56-91cc-4ad2-9087-24a5310c2bfc","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.499800Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:b600e1f51ac4f0debeac4cb9b490c2485e78089e97470bb640ae480319cdd02f","observation_id":"9ce82354-d169-42d4-b055-f69ac1ffb12e","resolution":{"observed_at":"2026-08-05T15:40:41.024585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.010912Z","title":"Needle in a multimodal haystack","venue":null,"work_id":"3c904e16-8959-4ef1-bb52-1bc945ad2be9","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.503121Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:fe3128351f6077a011b21b97d6e8fdd01f9f5e1b621deba422d53b3a24ad9121","observation_id":"32b649c9-7fce-441a-b8e3-b0e6c0690088","resolution":{"observed_at":"2026-08-05T15:40:41.013993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.000721Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"16962511-9323-4dd4-80b5-9115eb499d7c","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.506176Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:695f50473d3a08af7ffa58516fc7fedcf986021809948ac33bc1968dad420f31","observation_id":"a6e007d2-b029-4615-9b19-1fba9a0470be","resolution":{"observed_at":"2026-08-05T15:40:41.004212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.989675Z","title":"Mit- igating object hallucination via concentric causal atten- tion","venue":null,"work_id":"f93d2ef5-25f0-460a-80fc-928b3f7609ab","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.509168Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:c31d94d77f1dc5d8c24041ee0b92ccde7c8e7a462ecdf789e67ad860e30e4158","observation_id":"92174007-f620-44f5-b9a0-82522511e19b","resolution":{"observed_at":"2026-08-05T15:40:40.993509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.979743Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":"272ebe29-88b2-4e81-9a93-7b9000fd81d2","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.512623Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:23182ee463258b8a94b2d68e40fbc25ea092ca145e5043c0ffa6fb315c811cf2","observation_id":"84336aff-ced5-476d-8666-c87a70868ed4","resolution":{"observed_at":"2026-08-05T15:40:40.982894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.969450Z","title":"Re-thinking temporal search for long-form video understanding","venue":null,"work_id":"91be93e6-4309-47b9-89f1-8f54181a831f","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.516157Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:fc3f5dc0658ab8411789db319b62eca3ada471992d548ce31096879e11336d0e","observation_id":"f5b55030-f5c0-4c8c-9071-6ce23f26e5fd","resolution":{"observed_at":"2026-08-05T15:40:40.972907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.519503Z","title":"Lv-eval: A balanced long-context bench- mark with 5 length levels up to 256k","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.519503Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:87d7cc7d2a74d3c0a3b018ad1642a938ffa432414b57a0783fd0e06925c1027f","observation_id":"1e268707-996f-4d21-abc5-7fba0a759ac6","resolution":{"observed_at":"2026-08-05T15:40:40.519503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.958925Z","title":"Videorefer suite: Advancing spatial- temporal object understanding with video llm","venue":null,"work_id":"a4579493-0425-4160-894f-6ae8ee8932ef","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.522801Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:708de3714e7ec1dd3cfdb2ce92a127ef5b0b7e7972225652370d81b30b58ce06","observation_id":"9da279b6-3d77-42df-979f-b468a4b7351b","resolution":{"observed_at":"2026-08-05T15:40:40.962573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-05T15:40:40.525881Z","title":"Videollama 3: Frontier multi- modal foundation models for image and video understand- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.525881Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:74969cad8a92d989e708bffe98f924d920ff0251083accbc74ff95e7b4fcad34","observation_id":"a6aeea15-5916-4ff5-9296-8ba06b9838ef","resolution":{"observed_at":"2026-08-05T15:40:40.525881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.948371Z","title":"A simple LLM framework for long-range video question-answering","venue":null,"work_id":"0d06dba4-1a6d-4943-861e-c1c2f1b67d1a","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.529685Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:8b967fc067198d2e0b6225a0a1c576d31b0b4bc20fea31a100b35d3b6a3b61b6","observation_id":"f74b40df-1c1c-4347-b75b-3322c6cf4af1","resolution":{"observed_at":"2026-08-05T15:40:40.952156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.938112Z","title":"Long context transfer from language to vision","venue":null,"work_id":"eb61f42f-86b5-45ba-826c-662f770fe563","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.533027Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:9e289e7157f54126a7d0d3f3ab5c5eea2c686874b84d133f98ad8323904164bc","observation_id":"5ef51ecc-6e95-4b19-a3be-6fbefba61492","resolution":{"observed_at":"2026-08-05T15:40:40.941578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-05T15:40:40.536185Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.536185Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:bf9217cd354e86555e768b3e56a76b65f5bc295129a052d7402b0d867b9c978a","observation_id":"495fcdb7-43d6-4704-b7bb-7734549ef176","resolution":{"observed_at":"2026-08-05T15:40:40.536185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.927356Z","title":"Mmvu: Measuring expert-level multi- discipline video understanding","venue":null,"work_id":"918820c0-5c30-4eee-824e-a480613a3289","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.539944Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:f015a6c1a68839639b453f23665e7d436b7de5e06880486096db9becc6f8c69c","observation_id":"c4ad9bb9-4dd1-4262-9ca1-62d36a96c2d2","resolution":{"observed_at":"2026-08-05T15:40:40.931073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.916534Z","title":"Mlvu: Benchmarking multi-task long video understanding","venue":null,"work_id":"7b4af043-4956-4c4a-895f-83778a07f157","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.543150Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:3bd11c3f2b74eab3789665cc4a157afec9a8332b816af8cb6364daed87ce5918","observation_id":"d365e751-59a2-4134-a938-4fcb7e40192b","resolution":{"observed_at":"2026-08-05T15:40:40.919974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T15:40:40.546410Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.546410Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:0979ef1fcde2aa4f14046fc59086107c0c0342a1d62446504272873b7e07b997","observation_id":"5b09bca6-5e5e-4d1d-8e5a-92b3ea07ebcc","resolution":{"observed_at":"2026-08-05T15:40:40.546410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.905029Z","title":"Detection and tracking meet drones challenge","venue":null,"work_id":"fcb40a9d-3981-4ecc-8d3c-5da24507adf6","year":2021},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.549951Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:5d371ad2cbe9e109b56cac0255622dd5a23af022397bfa1b094c50019e7e2356","observation_id":"e7f879f7-f741-436c-a306-c62beb11157c","resolution":{"observed_at":"2026-08-05T15:40:40.908840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.893687Z","title":"Hlv-1k: A large-scale hour-long video benchmark for time- specific long video understanding, 2025","venue":null,"work_id":"8edf92ab-2b34-43e8-84d5-0952409cb656","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.553142Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:dc50ee490326358a8ca95c14012e6d7842642df6ae1b263b65c3b8e176fa78fb","observation_id":"7b3cf1e6-74a7-4c33-a225-b56aaea33ff1","resolution":{"observed_at":"2026-08-05T15:40:40.897972Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.882451Z","title":"three chairs,","venue":null,"work_id":"5adc27a0-edb9-473b-a861-df0af9df6877","year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.557088Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:66615986c6249c92a65d8083ffee780cde3b4955faed645d65e09ea0367e389a","observation_id":"2f25c3d7-ceb1-4d3f-b2cb-85be3c223669","resolution":{"observed_at":"2026-08-05T15:40:40.886292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.764483Z","title":"the lamp is on top of the desk,","venue":null,"work_id":"5e3cdc7b-5ec2-4084-9031-9992b6c1fa8c","year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.560393Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:e50bbce7c92bf9e3b7886fabf8af1bb9283e6f8aa5385dedc20fa93840592451","observation_id":"2747719c-ecce-4797-a12a-6d8f5f63f1d0","resolution":{"observed_at":"2026-08-05T15:40:40.768054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.753157Z","title":"nearby\" can be replaced with","venue":null,"work_id":"24da9b47-e395-46f2-8263-ed96091bf504","year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.564012Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:e269912d0e6e6befa4006fdedf6890ef84d83c966018b045ad300c627ac20d74","observation_id":"b2ae1e6c-6403-459c-8c95-e8b2abe56a88","resolution":{"observed_at":"2026-08-05T15:40:40.757346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:11:55.108109Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 2 inbound Pith citation observations for arXiv:2508.19650."}