{"as_of":"2026-08-06T07:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1db612086130198dfcaed23c45aa947ec3ed99023c79e6a9e557d3a4d8303618","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:22:31.310003Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.07639/citation-record","integrity":"/paper/2606.07639/integrity","json":"/paper/2606.07639/citation-record.json","paper":"/paper/2606.07639"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2304.08485","doi":"10.48550/arxiv.2304.08485","metadata_source":"pith","pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual Instruction Tuning","venue":"cs.CV","work_id":"68be622d-a6dc-4a13-82de-e3054a3dc509","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:bb4d1cd02c454c31586e15a70b416eb06b036eeb2a0842abac1e99a4780a8559","observation_id":"534d687e-f1f2-4106-8aff-bed773e4c5be","resolution":{"observed_at":"2026-07-01T22:26:17.939273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:73f78944b6fc68d3cae6e844a6ab753b3e296a4a32fd71c2528acd1fcbde0fe9","observation_id":"85416010-3373-4ff7-89de-6aa7fdbc2272","resolution":{"observed_at":"2026-07-01T22:26:17.941516Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-02T04:19:10.836301Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":"2407.15754","doi":"10.48550/arxiv.2407.15754","metadata_source":"pith","pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","venue":"cs.CV","work_id":"f6bb6dd9-35f5-4788-9063-af4d76699147","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:4d97c90af7a249b3e87e3f80b99aa77355822e4aad9668628b776184f9ce405b","observation_id":"b4edbaed-a809-41bb-8800-3283032b198b","resolution":{"observed_at":"2026-07-01T22:26:17.943893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11816","last_updated":"2024-06-17T17:55:32Z","snapshot_observed_at":"2026-08-02T08:01:10.902033Z","submitted_at":"2024-06-17T17:55:32Z","title":"VideoLLM-online: Online Video Large Language Model for Streaming Video","version":1},"cited_work":{"arxiv_id":"2406.11816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11816","snapshot_observed_at":"2026-07-01T22:26:17.921497Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":"509ce1d6-0f20-40a9-bd70-d14e2dfd5a5e","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2406.11816","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:61b625f2b452dee0ff034adec2cf2322b120d77dc8c09b9d889f94779dfc45ac","observation_id":"60fafe70-7195-453f-91c4-e1289c0ed508","resolution":{"observed_at":"2026-07-01T22:26:17.922925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.17991","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:48:55.463368Z","title":"Videollm knows when to speak: Enhancing time-sensitive video comprehension with video-text duet interaction format","venue":null,"work_id":"0bc13a71-30dd-466a-974f-09324d2a7814","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:764b7d0934e4030f5f3544154c72c815e0b3780d724f3a0601e6769aff6e22a4","observation_id":"cb9648f3-4db2-45db-9ff8-f7030cfec6b2","resolution":{"observed_at":"2026-07-01T22:26:17.976228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03218","last_updated":"2025-01-06T18:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2025-01-06T18:55:10Z","title":"Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction","version":1},"cited_work":{"arxiv_id":"2501.03218","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03218","snapshot_observed_at":"2026-07-01T22:26:17.926283Z","title":"Dispider: Enabling video llms with active real-time interaction via disentangled perception, decision, and reaction","venue":null,"work_id":"ddebbf8f-fd3e-4972-adce-027205da1952","year":2025},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2501.03218","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:0a8d7ae74e83b1bd2b2bc534cebdce428080db3d2e5bf1df73f19ce34fea3457","observation_id":"16ce67ef-091d-4468-a7a9-0547ad079b39","resolution":{"observed_at":"2026-07-01T22:26:17.927733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:58dd5cd950e603bea19577281a6a60da727eccbead7d7c9826948ec819acd7c2","observation_id":"23e42558-8c68-4240-b219-8f04add94e01","resolution":{"observed_at":"2026-07-01T22:26:17.934788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"cited_work":{"arxiv_id":"2605.25979","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.25979","snapshot_observed_at":"2026-07-02T02:46:28.010713Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","venue":"cs.CV","work_id":"4647c652-b82d-436f-a74d-ee82a38349ee","year":2026},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2605.25979","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:f8864745c22f9a877e4fcc1749886ada4db1dd785af66ff67ef3e9e9fbd1a16a","observation_id":"a584e931-e40a-462b-bbde-022ef2d05f03","resolution":{"observed_at":"2026-07-01T22:26:17.892593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:55a6e72dd5550c4d537856d6b560b32c4ac0ffa49f9b42f7adb5cbb70ee44f1d","observation_id":"5aa55b11-e67e-4d3f-a6c2-e7d06f5661d2","resolution":{"observed_at":"2026-07-01T22:26:17.897598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:4b1c919c256e3085906384b491716fc29c8487c01b1f8699df8bdce7389c4529","observation_id":"e5e0311c-cb62-4fb8-a2ce-2eda2d3962da","resolution":{"observed_at":"2026-07-01T22:26:17.983411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03628","last_updated":"2024-11-06T02:50:30Z","snapshot_observed_at":"2026-07-06T19:45:57.808548Z","submitted_at":"2024-11-06T02:50:30Z","title":"StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":"2411.03628","doi":"10.48550/arxiv.2411.03628","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03628","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video un- derstanding","venue":"arXiv (Cornell University)","work_id":"caec985b-dd2d-4dbb-9199-d147732de99a","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2411.03628","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:bfb9f6a8da3da774d716c9932269cbfa686f4151ee142b3ab3e4d4d0bce6a6c0","observation_id":"447d702c-84d8-44c7-8173-805dae8e90c5","resolution":{"observed_at":"2026-07-01T22:26:17.981195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05510","last_updated":"2025-03-27T17:40:09Z","snapshot_observed_at":"2026-07-06T20:18:58.432111Z","submitted_at":"2025-01-09T19:00:01Z","title":"OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?","version":2},"cited_work":{"arxiv_id":"2501.05510","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05510","snapshot_observed_at":"2026-07-04T03:19:29.950974Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding?","venue":null,"work_id":"aa3866ff-d08d-457f-be75-99b6b66be18f","year":2025},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2501.05510","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:cd3485e96d54b9ecc28175d3158dda71f4f2153503eac4848f7c86cae2c6cb9a","observation_id":"0f9ca443-8094-4aa5-aabb-c23d93a03b40","resolution":{"observed_at":"2026-07-01T22:26:17.968523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:aa311dde7dcfac74da03078f6995769040449126197d8fb6cb39db72f7a27faa","observation_id":"9d6e6827-dc1e-47e4-b382-c73b69027ce5","resolution":{"observed_at":"2026-07-01T22:26:17.913108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":"2104.09864","doi":"10.48550/arxiv.2104.09864","metadata_source":"pith","pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":"cs.CL","work_id":"4e5eee26-cd04-4c7a-988f-3e6d1a1f0eb9","year":2021},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:958018a35ceca3ec3528cb7527417e6fbba82250dda127c53f8412c2847196d2","observation_id":"d505dc38-4621-4f4f-9ce5-87459b303448","resolution":{"observed_at":"2026-07-01T22:26:17.910697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06939","last_updated":"2023-10-28T04:19:41Z","snapshot_observed_at":"2026-07-06T15:15:39.104303Z","submitted_at":"2023-04-14T06:17:46Z","title":"Multimodal C4: An Open, Billion-scale Corpus of Images Interleaved with Text","version":3},"cited_work":{"arxiv_id":"2304.06939","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.06939","snapshot_observed_at":"2026-07-01T22:26:17.900939Z","title":"Multimodal c4: An open, billion-scale corpus of images interleaved with text","venue":null,"work_id":"fc67e4a1-354a-4784-ac5b-f4d2f4f815d4","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2304.06939","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:b62ce7a9e07c3b5df0566dbc9981add496b034a1e616ed0357b30be6184394b5","observation_id":"6453e69f-deaf-40f8-811f-7358abe13d2d","resolution":{"observed_at":"2026-07-01T22:26:17.902355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16527","last_updated":"2023-08-21T09:35:52Z","snapshot_observed_at":"2026-07-06T15:48:01.777256Z","submitted_at":"2023-06-21T14:01:01Z","title":"OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents","version":2},"cited_work":{"arxiv_id":"2306.16527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.16527","snapshot_observed_at":"2026-07-01T22:26:17.906208Z","title":"Obelisc: An open web-scale filtered dataset of interleaved image-text documents","venue":null,"work_id":"74ebae26-b926-4191-8a01-1743f30cca60","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2306.16527","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:216a9c2706e5fd3628eb32eb3fc4fe25de8b6dedc670eedd591dfc1c159d64b1","observation_id":"a1ac21c0-ec49-4733-85b9-06aeb3e62c5e","resolution":{"observed_at":"2026-07-01T22:26:17.907664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.14738","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:26:17.916497Z","title":"UnifiedVisual: A framework for constructing unified vision- language datasets.arXiv preprint arXiv:2509.14738, 2025.https://arxiv.org/abs/2509.14738","venue":null,"work_id":"374abee9-2d5a-4e7c-abf8-bc681154e13a","year":2025},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:3cc90f55960fbcf8cb3efa6c8f95a0f2a85bfc9e5779b437fa2f5558fc9a9377","observation_id":"0701350a-dcd4-404e-ad4c-7204e4177d82","resolution":{"observed_at":"2026-07-01T22:26:17.917998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:071b9a1aad3c7210b61c017ee1f0d9507016689739cb7c81d8dbbfb8d9cc6615","observation_id":"3c4d1470-6226-4ca6-b937-0bda961159d8","resolution":{"observed_at":"2026-07-01T22:26:17.925212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:4403f26dcb3dd09e40eb2a9a19bc1ef67b6e24f51dc91df4c6f3677edae71f9d","observation_id":"d9cb0997-5ccb-4b5f-89c3-df9657029bc5","resolution":{"observed_at":"2026-07-01T22:26:17.970978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.14735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:26:17.972017Z","title":"DecoupledProxyAlignment: Mitigatinglanguagepriorconflictfor multimodal alignment in MLLM.arXiv preprint arXiv:2509.14735, 2025.https://arxiv.org/abs/2509.14735","venue":null,"work_id":"0f1de30b-ee34-48fa-b837-1a8a65dc3031","year":2025},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:51eb3517a9dfd83ca8fedc216a20a7de9d67679ec59a258070204d3a8ac0ef4e","observation_id":"f77726b6-5cd0-4e28-82dd-7801f22a5c80","resolution":{"observed_at":"2026-07-01T22:26:17.973465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":"1910.02054","doi":"10.48550/arxiv.1910.02054","metadata_source":"pith","pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","venue":"cs.LG","work_id":"c5e9ad7b-c11d-43b7-b02d-c46d74a77fa9","year":2019},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:26532068ea0e27d939e9dfde0fe586450813be1a176865f2613f90cd650f5fa2","observation_id":"4cb2791f-4d7a-4090-bdd8-ee8f967339d4","resolution":{"observed_at":"2026-07-01T22:26:17.930062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.137438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.137438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:59ef1bcdea347874f9b8c4bb81481cc9b85bbebd6ba4892b14c19fa7a98e4432","observation_id":"67bf9386-ea11-4b0f-99dd-e994e8c4f025","resolution":{"observed_at":"2026-07-01T22:26:17.877757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":"2305.07895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-07-01T22:26:17.944984Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","venue":"cs.CV","work_id":"521163e9-4c77-4c73-8b7f-9a6aa75b6d3b","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:4c6de22dab7cef5d146d561ab4112f3577852aae92a029c580a8965e7f05b9ca","observation_id":"371c0666-998b-4f2c-a4cc-9596ea918a4a","resolution":{"observed_at":"2026-07-01T22:26:17.946170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-02T21:55:15.857183Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:12a7972fdd8ddd9b162e831ba08d87368602354b7545e1c640cebc15368fd18a","observation_id":"c87cbb39-249b-4dbb-8d9e-978cbcacd063","resolution":{"observed_at":"2026-07-01T22:26:17.884886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":"2307.06281","doi":"10.48550/arxiv.2307.06281","metadata_source":"pith","pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","venue":"cs.CV","work_id":"3b44943d-0f15-4228-9ac3-0e376f4f9ada","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:83a4de88c6e65dfd96bca843b49a4427025a492604c19011232fadc48c919fbb","observation_id":"3d7ff161-b207-4f19-91ff-0fc4fcd01313","resolution":{"observed_at":"2026-07-01T22:26:17.904946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":"2311.16502","doi":"10.48550/arxiv.2311.16502","metadata_source":"pith","pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","venue":"cs.CL","work_id":"da087b16-ea05-4064-980e-ce1d6e281d49","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:f7fb84366de753dd2012c0eebc5ee9f279825970d8e26d503d0aab98d3fe09cf","observation_id":"f3ff5ea9-bbf9-4409-89c5-16109cac203c","resolution":{"observed_at":"2026-07-01T22:26:17.932464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:22:31.310003Z","title":"RealWorldQA: A new benchmark for real-world multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:d1b7fb8a0644c927e0e3d123b0cd48b57355cc5b9dade824bbbf6002ad5afa5b","observation_id":"6bdc7b07-3731-431c-8f1e-af0354dab525","resolution":{"observed_at":"2026-06-28T15:22:31.310003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-06T06:55:40.622967Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":"2406.09411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-07-04T21:00:08.872451Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","venue":"cs.CV","work_id":"9303f540-1c57-4c25-bed8-4456eb1c7e17","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:6507f2e31cc45387d265b225619a2822fd2df074591cc8e335c79a43b73ffd6a","observation_id":"097fb2a1-fe27-49a9-b5c3-89cd04b0f600","resolution":{"observed_at":"2026-07-01T22:26:17.937097Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":"2307.16125","doi":"10.48550/arxiv.2307.16125","metadata_source":"pith","pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":"cs.CL","work_id":"23881ff0-b851-474c-8712-90744cc07a3a","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:c2d7b49ab305940587b4fcbbf6a4821afc7f0b8de31a9670fb723cacf11aa32f","observation_id":"ff3a96f7-ff3e-48c4-86c5-e012a0edf410","resolution":{"observed_at":"2026-07-01T22:26:17.915441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":"2408.13257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-07-08T06:34:41.869562Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","venue":"cs.CV","work_id":"140d79fb-a3d2-4af2-a436-9d997c171f61","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:de50292232ab12ea4e1c75dabf2453d7b274b6e2e734cc372b302ddf92f711cd","observation_id":"73fe40b3-7ea2-4124-a1b0-8a33a705c4f6","resolution":{"observed_at":"2026-07-01T22:26:17.963272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2305.10355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-07-10T11:37:03.198858Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":"cs.CV","work_id":"66d8ac3e-c134-4995-b528-550afa17586f","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:5cf38061aca590a02efe1e25ab5a322d6ed95bfca0e43939f3255ae99f99dcf6","observation_id":"cedf9d78-4bc6-4fbc-b4b2-628871e7c466","resolution":{"observed_at":"2026-07-01T22:26:17.953615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2406.16860","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-07-03T23:49:02.295501Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","venue":"cs.CV","work_id":"f305b8a2-d78e-4bf3-b9fd-41777382e536","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:d069508218b265f1b40829e215049bce99371eeb0a3ddb134a4bf930cac4fe0a","observation_id":"84b003d3-ed6e-47e1-a363-22ad5f129c1f","resolution":{"observed_at":"2026-07-01T22:26:17.948743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-04T14:26:27.153017Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:9e67f4c265f00dcb480af9422bfe1fab92cf146fe57c59603b5084ed5cae0db1","observation_id":"79c455c0-6e7c-4123-848c-947c636d6fd2","resolution":{"observed_at":"2026-07-01T22:26:17.951269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.07396","last_updated":"2016-03-24T00:02:58Z","snapshot_observed_at":"2026-08-02T15:46:58.530939Z","submitted_at":"2016-03-24T00:02:58Z","title":"A Diagram Is Worth A Dozen Images","version":1},"cited_work":{"arxiv_id":"1603.07396","doi":null,"metadata_source":"pith","pith_arxiv_id":"1603.07396","snapshot_observed_at":"2026-07-04T00:49:19.064422Z","title":"A Diagram Is Worth A Dozen Images","venue":"cs.CV","work_id":"3cc7177d-7f05-4d4d-8066-04b7d589017f","year":2016},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/1603.07396","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:3ea2f7fe033cabb67872dcb6c3ad3e89bb6ef78fe910d92427c39c0bf316c39c","observation_id":"ac6e24e2-42c4-40c5-b845-0546edbf288e","resolution":{"observed_at":"2026-07-01T22:26:17.955779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-04T21:46:45.619744Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2504.15279","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-07-08T23:55:43.050247Z","title":"Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models","venue":"cs.CV","work_id":"a380ccb5-e994-4933-b73d-d8df0105e038","year":2025},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:e729b5318c040feeadf2223ee246cf2656c3beb51e8c2a66f1787f7a768c6433","observation_id":"cd534004-9d1b-4be6-bba6-129580f50e80","resolution":{"observed_at":"2026-07-01T22:26:17.958425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-03T13:03:43.962537Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":"2407.06581","doi":"10.48550/arxiv.2407.06581","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision language models are blind","venue":"arXiv (Cornell University)","work_id":"21fe7700-6786-4b12-a1dd-88d16b4403c2","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:d65ce757c6f85ca9594fb82972c6567ef91e97ed1f905699f32f770e6bfb70dd","observation_id":"8068ad65-ea6a-480c-9149-ba38d04dddc3","resolution":{"observed_at":"2026-07-01T22:26:17.978721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-03T11:27:21.448208Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2502.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-08T01:19:04.778549Z","title":"Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Flo- rian Langer, Vyas Raina, and 1 others","venue":null,"work_id":"33b36799-0b42-4ac7-893c-5fc4a26c671c","year":2025},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:d4fd00446fb1b9d87321db36fa2dede5762e1a90b49c113ac8acaf5480d6b7fb","observation_id":"a0a912cf-793d-4413-8cd4-8a37758a026f","resolution":{"observed_at":"2026-07-08T01:19:04.778549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:22:31.310003Z","title":"Video-MME: The first-ever comprehensive evaluation benchmark of multi-modal LLMs in video analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:3ff7697ad2d4bda3189acd4eaa7320da9842198f52d5ce1ed1aa496d55858968","observation_id":"105ca07b-9b98-47b6-b929-cba92bd9d553","resolution":{"observed_at":"2026-06-28T15:22:31.310003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:2fde80a993367cb2a9b323f8094cf3ed6163ef34d7734d72723110a7fac7e5c9","observation_id":"fc4d7ccb-aa1d-498d-b469-0e2de9b20030","resolution":{"observed_at":"2026-07-01T22:26:17.887459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-07-06T16:07:21.951225Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":"2308.09126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-07-04T16:39:57.306434Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"f35031d8-b7b8-43e1-9226-b435af540d6a","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:15c5673ef5410d144cf64d52a66594b0b503219599f5869a12ecb55923b05bb2","observation_id":"2ceec0df-85e7-4ce4-8fab-9895482f6318","resolution":{"observed_at":"2026-07-01T22:26:17.890023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":"2406.04264","doi":"10.48550/arxiv.2406.04264","metadata_source":"pith","pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","venue":"cs.CV","work_id":"346256da-dd21-4cc3-9a98-519467614854","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:c56a763ae1758a6a887e16a7f212a2c73fe4c234f66cc7886ba4e6850e00171e","observation_id":"a6cfca76-03ff-4d9c-8ff4-4126eae2738e","resolution":{"observed_at":"2026-07-01T22:26:17.899862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2406.08035","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-07-04T16:09:57.146670Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","venue":"cs.CV","work_id":"e9bfdf40-cd28-4d57-98b8-31b7e97f9f2f","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:48685a7c3ad5de452b6e34ff24419714590a0a28c6716d0b4977af0eed92d75a","observation_id":"63c5fe9e-b0b1-4fc7-ae31-c4533b20762f","resolution":{"observed_at":"2026-07-01T22:26:17.875305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":"2403.00476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-07-04T10:29:44.911015Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","venue":"cs.CV","work_id":"88f4d72e-ee93-420a-a61e-64b02b8cc454","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:aaa42cde89bc099200cbd67d282bb2fe7f035af29a4765b690819138e9f8529a","observation_id":"90702f37-b6a1-43ac-b4c9-8a60aa5978b5","resolution":{"observed_at":"2026-07-01T22:26:17.880051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":"2412.14171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-07-04T06:29:37.915954Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","venue":"cs.CV","work_id":"bbaf0f51-258a-4d79-b5a4-5b1e9120b2c0","year":2024},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:2fb4f78961833fad5b1ede7396f34bfc411b585e8c5b13557f019af4f4ab9068","observation_id":"2a3e8e24-21ee-441d-843d-3676576839c0","resolution":{"observed_at":"2026-07-01T22:26:17.882445Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-06T04:32:21.352745Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"cited_work":{"arxiv_id":"2505.21374","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21374","snapshot_observed_at":"2026-07-04T16:39:58.338552Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","venue":"cs.CV","work_id":"6d26f54b-33e5-4b18-86b0-7202ab41b867","year":2025},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2505.21374","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:e66968c88968aa4891335e55362faa63cdf1af1a32337a3a17f82500d6800acb","observation_id":"eb17668b-b0cc-4e76-afc5-6aa23abbb5d1","resolution":{"observed_at":"2026-07-01T22:26:17.895174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":"2307.08691","doi":"10.48550/arxiv.2307.08691","metadata_source":"pith","pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":"cs.LG","work_id":"fff3953b-5efb-4753-bee4-002f59995810","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:5133845f6f25b387ec0082ddb5b0eae80257b0f877295e658488d44315f438b2","observation_id":"345cf5bf-79cf-4c81-a392-20a444a110de","resolution":{"observed_at":"2026-07-01T22:26:17.867656Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:a36b87e45149ac2de87d1c38c94d6cfbdba1995bb8442b14e6f8524cab924207","observation_id":"ed4aedf6-16e5-45f9-8473-46938f380488","resolution":{"observed_at":"2026-07-01T22:26:17.920371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:c9283cf87fba22e8de27978973cac25ba4ddf245172b4f537f72453395b65302","observation_id":"7a305ea6-81a4-47e7-8f6a-0496b716f718","resolution":{"observed_at":"2026-07-01T22:26:17.960754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:85b17b689b211efd6a09b48cb34a9edde0c83aef328470c09da7bfeedcf9a966","observation_id":"e1ab2ef0-4a6a-430f-bc6b-f17efd817e57","resolution":{"observed_at":"2026-07-01T22:26:17.870244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-05T01:25:49.519251Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:31d70f39a03134befaf4c7b12ccc78f7554b10654820e26ab5a96cd96c9cd9d6","observation_id":"702f9e44-561d-495f-a5ef-ae30dc9bc281","resolution":{"observed_at":"2026-07-01T22:26:17.872984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":2,"verified_exact":44,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2606.07639."}