{"as_of":"2026-08-12T21:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e174a91fcca42217d2236d43f0724e4b4da19859106fd6b73f83e36cf2727a3c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":44,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:40:23.734088Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T17:40:00.906584Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:53.284345Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2406.07476"},"observation_digest":"sha256:4d56a2b9397f49f053ebe8890694ca0015a454d60f7b6deea368a11f9690a964","observation_id":"7868b652-9b62-4519-befa-8237bb57d600","resolution":{"observed_at":"2026-05-11T02:44:53.686898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:aff622624e98e1cb2f5691edc83496007cd1e7a9f224c2edb34c1f742d4d0d2d","observation_id":"0be139c6-460b-4b87-ae5c-c34e807f64df","resolution":{"observed_at":"2026-05-10T23:20:32.962559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-12T14:40:23.734088Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-12T14:33:48.981338Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:40:23.734088Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2411.15024"},"observation_digest":"sha256:81cd2e5f0a7a8f6f84a4f0a7c6757ce87e6e6c441a4ab4ee58d2cd97e8a5fdc0","observation_id":"f6822db5-7cbd-4ebd-8023-6aa5e8df054d","resolution":{"observed_at":"2026-08-12T14:40:23.734088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-11T04:49:22.222888Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T08:38:27.946746Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2412.00131"},"observation_digest":"sha256:43358d1dd77039dea5457ab275cf3598e0857dfac25ae096abbc8c2b79d52532","observation_id":"e108ea2e-3b48-4b8c-91e9-463ea9edbf50","resolution":{"observed_at":"2026-05-23T08:42:45.194961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-12T05:16:59.601418Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00596","last_updated":"2025-04-01T09:33:55Z","snapshot_observed_at":"2026-08-12T11:08:40.105379Z","submitted_at":"2024-11-30T22:02:12Z","title":"PhyT2V: LLM-Guided Iterative Self-Refinement for Physics-Grounded Text-to-Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:16:59.601418Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2412.00596"},"observation_digest":"sha256:3d5ea6c42035fb679f6e0d8f2d8861278374ac70425a3c85d1b37c2578e9d6c7","observation_id":"8b4458b4-060b-4a33-bdfa-057b2f6d6052","resolution":{"observed_at":"2026-08-12T05:16:59.601418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-11T23:55:58.545529Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02071","last_updated":"2025-03-26T02:26:56Z","snapshot_observed_at":"2026-08-12T14:25:07.573910Z","submitted_at":"2024-12-03T01:21:28Z","title":"Progress-Aware Video Frame Captioning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:58.545529Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2412.02071"},"observation_digest":"sha256:5db8128d1a93c848c6cdb904e1818b486492c579e241e222e292f2e3c5a45cb7","observation_id":"3ee4e1f2-cd67-4798-a8a9-e436db706eac","resolution":{"observed_at":"2026-08-11T23:55:58.545529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-11T20:54:16.477303Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05185","last_updated":"2024-12-11T14:43:02Z","snapshot_observed_at":"2026-08-12T09:36:58.123071Z","submitted_at":"2024-12-06T17:04:42Z","title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T20:54:16.477303Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2412.05185"},"observation_digest":"sha256:b3d553a8df15bd684861be92c6242051e68bda1644cfcc0652abfd0dcbad227e","observation_id":"1f9c87a1-a224-42c3-87d2-2b5769e407f0","resolution":{"observed_at":"2026-08-11T20:54:16.477303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-11T16:56:42.664942Z","title":"Tarsier: Recipes for training and evalu- ating large video description models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09613","last_updated":"2024-12-12T18:59:40Z","snapshot_observed_at":"2026-08-11T17:35:07.633589Z","submitted_at":"2024-12-12T18:59:40Z","title":"PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models","version":1},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-08-11T16:56:42.664942Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2412.09613"},"observation_digest":"sha256:429743a40384cb1607234bbedbc92ba08a9104cff9e0733cca8248c2c6924cb3","observation_id":"c0db57b7-51b8-4e78-8b50-f50461a269ac","resolution":{"observed_at":"2026-08-11T16:56:42.664942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-10T22:52:00.945147Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00513","last_updated":"2025-03-18T16:01:24Z","snapshot_observed_at":"2026-08-10T22:46:57.431139Z","submitted_at":"2024-12-31T15:53:50Z","title":"CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:52:00.945147Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2501.00513"},"observation_digest":"sha256:79e59dc483733ea368c3192cea8af42ea39f3c923b5204c32446d0253efceed5","observation_id":"0b4c1064-cd9d-4bfc-afc1-2fc19c77a335","resolution":{"observed_at":"2026-08-10T22:52:00.945147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-09T23:03:34.652174Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18565","last_updated":"2025-04-01T03:18:58Z","snapshot_observed_at":"2026-08-10T11:27:03.122346Z","submitted_at":"2025-01-30T18:38:09Z","title":"BounTCHA: A CAPTCHA Utilizing Boundary Identification in Guided Generative AI-extended Videos","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-09T23:03:34.652174Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2501.18565"},"observation_digest":"sha256:7cf60601c2de67dd247f16e83f637aab632f5b7c604d32d3efd6baea2a0f15e4","observation_id":"29df199b-4fd9-4a7e-9473-d21570d2bad3","resolution":{"observed_at":"2026-08-09T23:03:34.652174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-08T21:07:32.440706Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-12T10:25:15.696441Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.440706Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:1d775dfd50d9e6301193c36f186b01c2b661993abe74da2445bd5e081fff5b14","observation_id":"63f8375a-2a2e-47a9-a9bf-2f2200751a76","resolution":{"observed_at":"2026-08-08T21:07:32.440706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T20:56:07.247122Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2504.06958"},"observation_digest":"sha256:16a2284c4aaf31dad4973bdee3ba9e8257016a1ad97ec41df788e4a45584bed6","observation_id":"1ba35c61-2595-4c3e-81cc-798898ead23d","resolution":{"observed_at":"2026-05-15T20:56:07.869285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:98d3e686361266f41a0c0816d4fab94664e55ed29c9798e245702c44f544c8b5","observation_id":"d31b4ecc-a26f-4da3-b04f-050dde267969","resolution":{"observed_at":"2026-05-11T05:26:05.594061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-07T14:14:44.083171Z","title":"Tarsier: Recipes for training and evaluating large video description models.arXiv preprint arXiv:2407.00634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-09T09:30:25.697403Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.083171Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:b76d9d8ba342f803dc78931ef12a63249821d898120f719b5de68581f1d381fb","observation_id":"4165373e-c41e-4f73-bb44-aa18251c6109","resolution":{"observed_at":"2026-08-07T14:14:44.083171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-07T14:03:04.111822Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:04.111822Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:aa5e6da8f9468e709e57bede9f332b330692e215c33720b737f5f4ba9f959dc4","observation_id":"e152143e-f3e1-440b-be7d-f896473bbd0b","resolution":{"observed_at":"2026-08-07T14:03:04.111822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2505.20715","last_updated":"2026-04-18T02:55:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-27T04:50:07Z","title":"MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T13:13:40.485342Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2505.20715"},"observation_digest":"sha256:f0fda8301703f5df85a3fe8e8803c96a21041c11cd628bc8e03373c2f9c7be12","observation_id":"8f47666e-7b6c-4623-bfbb-7765955299fa","resolution":{"observed_at":"2026-05-19T13:17:18.490044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-07T11:40:35.885400Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:35.885400Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:99436df81d52378552ab671117c6c516ebcd1bece38eca988003b1b04ebb37b7","observation_id":"c314e2d9-ad47-490c-a7b0-549e292d25e3","resolution":{"observed_at":"2026-08-07T11:40:35.885400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-07T10:28:50.622545Z","title":"Tarsier: Recipes for training and evaluating large video description models.arXiv preprint arXiv:2407.00634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:50.622545Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:4effd050e9e6dc2b046d4e709f277119c9bd4e71a41420bf2c7e3d5baffbc079","observation_id":"543f8e17-0ffc-4fd6-aac0-f39935557265","resolution":{"observed_at":"2026-08-07T10:28:50.622545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-07T10:29:10.194652Z","title":"Tarsier: Recipes for training and evaluating large video description models.arXiv preprint arXiv:2407.00634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05287","last_updated":"2025-06-05T17:44:12Z","snapshot_observed_at":"2026-08-12T14:24:44.641325Z","submitted_at":"2025-06-05T17:44:12Z","title":"EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:10.194652Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2506.05287"},"observation_digest":"sha256:37f24c92b20a0130d921949bca5b7ef4b33654ed69278d2510510b626d8de14b","observation_id":"b82aeb2f-ca6e-4fb8-a96a-3af13f1bd4a5","resolution":{"observed_at":"2026-08-07T10:29:10.194652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-07T05:51:07.884760Z","title":"Tarsier: Recipes for Training and Evalu- ating Large Video Description Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-10T12:00:26.470686Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.884760Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:56c0b72bd39ee742784b23eabcd9e8eff1f9a2d04bd8b4fdf438d564f88339c5","observation_id":"0cb707a5-6917-4e9f-b00d-1c255f096643","resolution":{"observed_at":"2026-08-07T05:51:07.884760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-06T15:53:33.251744Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14784","last_updated":"2025-08-18T09:06:46Z","snapshot_observed_at":"2026-08-09T23:46:47.099823Z","submitted_at":"2025-07-20T01:57:00Z","title":"LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:53:33.251744Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2507.14784"},"observation_digest":"sha256:bb425a668bda037d0413a3eb3278f3d1e8a243cb1c8525bec410ac4a9e1f1c9c","observation_id":"c455dc02-2b25-4543-a95a-d0536125090a","resolution":{"observed_at":"2026-08-06T15:53:33.251744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2512.13511","last_updated":"2026-05-01T11:23:38Z","snapshot_observed_at":"2026-07-06T22:39:04.164003Z","submitted_at":"2025-12-15T16:38:59Z","title":"Adapting MLLMs for Nuanced Video Retrieval","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:09.051957Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2512.13511"},"observation_digest":"sha256:d2068e5797ab187247e21b84d94e3dac7cbc0028b11f68ecc4edc2ebe22876f5","observation_id":"b62dbf61-4e24-4aa2-be39-3f4e90809c3f","resolution":{"observed_at":"2026-05-16T22:21:18.933713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2602.00181","last_updated":"2026-04-14T16:44:13Z","snapshot_observed_at":"2026-07-06T22:43:50.689500Z","submitted_at":"2026-01-30T04:45:43Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T10:02:20.477517Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2602.00181"},"observation_digest":"sha256:d90abe0e38293640c764b700a84c34e630bb06b17f119c8f8d25920ac6dbf900","observation_id":"245512fd-c346-4587-9d79-985335bf2157","resolution":{"observed_at":"2026-05-16T10:02:42.441350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2603.03944","last_updated":"2026-04-03T20:11:12Z","snapshot_observed_at":"2026-07-06T22:47:46.409064Z","submitted_at":"2026-03-04T11:09:39Z","title":"SCP: Spatial Causal Prediction in Video","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T16:47:44.523606Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2603.03944"},"observation_digest":"sha256:03053ae37ae4ef528ab43545151b538f5494de54249de25c3dd7886fde1ec8dc","observation_id":"acb55947-e818-425b-b074-60982699ea2b","resolution":{"observed_at":"2026-05-15T16:50:11.211833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2604.02891","last_updated":"2026-04-03T09:00:38Z","snapshot_observed_at":"2026-08-11T16:19:37.738972Z","submitted_at":"2026-04-03T09:00:38Z","title":"Progressive Video Condensation with MLLM Agent for Long-form Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T20:40:41.380829Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2604.02891"},"observation_digest":"sha256:4ca7d69aeb85f4c916fce70d66dba70a175758c61a8a2364b5fa86c4887a0044","observation_id":"31ef9471-cb5c-43dd-924d-6b79638221e1","resolution":{"observed_at":"2026-05-13T20:43:14.858948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-11T01:00:18.605708Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:aba57d10076be3868a3e91b4c57cd607f0148e04ad6b35756d47b4c9e3dc671c","observation_id":"3b876ced-1ea4-4dad-ac02-ba66176a193c","resolution":{"observed_at":"2026-05-11T13:46:04.401243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2605.14569","last_updated":"2026-05-14T08:39:42Z","snapshot_observed_at":"2026-08-05T11:27:50.353545Z","submitted_at":"2026-05-14T08:39:42Z","title":"Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-15T01:51:57.018809Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2605.14569"},"observation_digest":"sha256:823a87130fdd66f21a80187b2b5643e48beab03cc0b647e43329ee1d9887695f","observation_id":"97a2f1b6-2f1e-4d05-bab6-e6c6324a2baa","resolution":{"observed_at":"2026-05-15T01:53:28.934400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2605.20165","last_updated":"2026-05-19T17:50:25Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:50:25Z","title":"CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-20T05:27:30.938311Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2605.20165"},"observation_digest":"sha256:f0e306084f6df169008fe6e5fc89e74d49cdb45a7a4f684b90fba0591862a2f8","observation_id":"38714149-295f-4abe-9ab5-d23f4216ba24","resolution":{"observed_at":"2026-05-20T05:28:04.465276Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2605.28023","last_updated":"2026-05-27T06:27:04Z","snapshot_observed_at":"2026-08-02T21:20:31.316522Z","submitted_at":"2026-05-27T06:27:04Z","title":"VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T13:13:57.599970Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2605.28023"},"observation_digest":"sha256:694ceb5f6e6b4eff06c91365d5712e39dbb22b776d53a6fcaff19d5de034ec7d","observation_id":"c55f7ec3-6104-41fc-870c-a9ab35371b3e","resolution":{"observed_at":"2026-06-29T13:23:28.434241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2606.05748","last_updated":"2026-06-04T06:20:23Z","snapshot_observed_at":"2026-08-10T04:46:55.422655Z","submitted_at":"2026-06-04T06:20:23Z","title":"UNIVID: Unified Vision-Language Model for Video Moderation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T22:56:26.674841Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2606.05748"},"observation_digest":"sha256:678ff11473e6a8355bc01d6f31436efbec55181902e1ea3700314941f87d2aef","observation_id":"779d8d9e-b6f3-4051-86a8-a7c4d19b3f41","resolution":{"observed_at":"2026-07-02T16:07:09.272703Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2606.06853","last_updated":"2026-06-05T02:56:48Z","snapshot_observed_at":"2026-08-12T20:40:00.828973Z","submitted_at":"2026-06-05T02:56:48Z","title":"MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T22:49:18.420491Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2606.06853"},"observation_digest":"sha256:b52da707e6345037612c39588a39763f9c82d9af2de5637a282de6572c16b220","observation_id":"d58a1299-f53b-4cbb-8f78-1f7c9e333eba","resolution":{"observed_at":"2026-07-02T16:17:09.548729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:f5db5b1f77a45df26e26b99b54019f22933b118eec0d4a2d29f5e32b112e10fd","observation_id":"6909c904-fb97-4a95-aee1-5bbac09e37f0","resolution":{"observed_at":"2026-07-02T17:27:15.770571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2606.07643","last_updated":"2026-06-01T19:12:09Z","snapshot_observed_at":"2026-08-04T07:32:54.888878Z","submitted_at":"2026-06-01T19:12:09Z","title":"AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-28T14:36:53.295540Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2606.07643"},"observation_digest":"sha256:a38fbf7e291cacf5acf5a23f4ffe87c91c3eefd3357efafb83d3011b3668ef42","observation_id":"f129b174-1b38-463b-a386-c40262bf78de","resolution":{"observed_at":"2026-07-01T23:06:21.312897Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2606.09181","last_updated":"2026-06-08T08:20:42Z","snapshot_observed_at":"2026-07-06T23:48:35.190418Z","submitted_at":"2026-06-08T08:20:42Z","title":"Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T16:55:35.743040Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2606.09181"},"observation_digest":"sha256:beee702d5fc66f9df02e28dad86e85c83bc2bd3c43ccf2e52ebfa1f0c80af74c","observation_id":"e33d93dd-136a-4769-8026-647da8b3bed4","resolution":{"observed_at":"2026-07-03T00:57:30.176143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2606.09393","last_updated":"2026-06-08T12:09:20Z","snapshot_observed_at":"2026-08-07T21:51:25.793927Z","submitted_at":"2026-06-08T12:09:20Z","title":"CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-27T17:21:38.543724Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2606.09393"},"observation_digest":"sha256:ce3d5c814e57461a583ba673090968ca2374540a496bc72d57a589a97d8221db","observation_id":"9b7429ba-3931-4175-861f-4f270f630a92","resolution":{"observed_at":"2026-07-03T00:17:29.024209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":297,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:29e6da0921d0ec8f37724aaf899b09ec0e80e8cc610aac581fb05fa61d1b68d9","observation_id":"2902fe35-5cb6-4ef3-83a3-04289e077e83","resolution":{"observed_at":"2026-07-03T10:48:03.121610Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2606.24636","last_updated":"2026-06-23T14:29:40Z","snapshot_observed_at":"2026-08-07T23:34:44.066451Z","submitted_at":"2026-06-23T14:29:40Z","title":"CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-25T23:29:24.520537Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2606.24636"},"observation_digest":"sha256:b539e8628108d90bfd1379eadd439a80be63022b3836aee8ed925918d35aad2e","observation_id":"1efce4af-dece-45af-8191-c58b9bd5045a","resolution":{"observed_at":"2026-07-04T17:40:00.907967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:7f62cc3ba84b01414cf0bf71bbf40779b6161054fcc80b626776d22a6941ef9c","observation_id":"87c325a0-12db-4fe8-b67c-73b20cc29f7e","resolution":{"observed_at":"2026-07-04T15:09:55.256819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2606.29531","last_updated":"2026-06-28T17:54:55Z","snapshot_observed_at":"2026-08-12T20:40:34.882998Z","submitted_at":"2026-06-28T17:54:55Z","title":"MotionAtlas: Detailed Region Captioning for Motion-Centric Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T07:21:46.783970Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2606.29531"},"observation_digest":"sha256:a7e92976468505fc6157e885895481332578c22b29c52f975151b7175376acca","observation_id":"de2f74fc-0519-4b49-ba64-ce5e88f3af4a","resolution":{"observed_at":"2026-06-30T07:24:21.158963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2607.01667","last_updated":"2026-07-02T03:47:45Z","snapshot_observed_at":"2026-08-05T09:34:18.453279Z","submitted_at":"2026-07-02T03:47:45Z","title":"Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-03T16:37:06.384435Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2607.01667"},"observation_digest":"sha256:8b84fc00bd9c518b0e7877a10b9faef2eba1eb9ddf13d78bb43cabbcccac5edb","observation_id":"a0274c15-76c9-48f4-a8cb-a533aa800a29","resolution":{"observed_at":"2026-07-03T16:38:39.648627Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2407.00634 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":167,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:1cc74118d5e33cb34f652ef05b67145579b78b63bd3a29c9cc01f76284f3c179","observation_id":"1a17a28f-d18a-4b89-92f5-7f5b45e0daa2","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-01T10:02:03.243631Z","title":"Tarsier: Recipes for training and evaluating large video description models.CoRR, abs/2407.00634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20389","last_updated":"2026-07-22T17:17:33Z","snapshot_observed_at":"2026-08-07T12:38:32.377959Z","submitted_at":"2026-07-22T17:17:33Z","title":"PercepCap: Video Captioner with Structured Spatio-Temporal Perception","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T10:02:03.243631Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2607.20389"},"observation_digest":"sha256:24bd6186368732070c35dbaec8c118f5a6f4c2845c8aa77b20f35a1c4b8361ba","observation_id":"0f4661c7-a4c4-4aeb-8791-76af60bd4357","resolution":{"observed_at":"2026-08-01T10:02:03.243631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-31T05:08:20.012837Z","title":"Tarsier: Recipes for training and evaluating large video description models.arXiv preprint arXiv:2407.00634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.012837Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:8119607fc8591bf903e2e19a9c1501d34340401640a56b227ac2de7df05cbea1","observation_id":"9643093e-bfed-4251-9083-b15b50c20ec5","resolution":{"observed_at":"2026-07-31T05:08:20.012837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-10T18:13:44.059127Z","title":"Tarsier: Recipes for training and evaluating large video description models.arXiv preprint arXiv:2407.00634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T21:10:43.326274Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.059127Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:e8a22b42fa952f68d35dc981f54508473f815b437f5d69059fa03ebcac70dbaa","observation_id":"90db9274-bbf3-46ad-8514-45a615392547","resolution":{"observed_at":"2026-08-10T18:13:44.059127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.00634/citation-record","integrity":"/paper/2407.00634/integrity","json":"/paper/2407.00634/citation-record.json","paper":"/paper/2407.00634"},"outbound":[],"paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 44 inbound Pith citation observations for arXiv:2407.00634."}