{"as_of":"2026-08-08T16:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:583ae6541bd69aadaf29f8af8ca8a670f362455aef3a00365ab8f8f50e5fb31b","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:21:08.559862Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T08:27:03.674229Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:33:15.607500Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2505.15435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15435","snapshot_observed_at":"2026-06-29T08:33:15.607500Z","title":"Timecausality: Evaluating the causal ability in time dimension for vision language models","venue":null,"work_id":"a5bbc6a7-8486-45d2-98e6-f5c8ec24d426","year":2025},"citing_paper":{"arxiv_id":"2512.01843","last_updated":"2026-05-18T11:10:13Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T16:28:13Z","title":"PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T17:57:57.263574Z"},"links":{"cited_paper":"/paper/2505.15435","citing_paper":"/paper/2512.01843"},"observation_digest":"sha256:ada2058e0c03818b6c08e698bb2eb8d474c51a9789ca522c5210a4a0ae5c8e3e","observation_id":"8a733963-de16-4af8-853e-52b0ee40ef37","resolution":{"observed_at":"2026-05-21T18:00:27.293745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2505.15435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15435","snapshot_observed_at":"2026-06-29T08:33:15.607500Z","title":"Timecausality: Evaluating the causal ability in time dimension for vision language models","venue":null,"work_id":"a5bbc6a7-8486-45d2-98e6-f5c8ec24d426","year":2025},"citing_paper":{"arxiv_id":"2605.09591","last_updated":"2026-05-10T15:07:17Z","snapshot_observed_at":"2026-07-31T21:46:37.121236Z","submitted_at":"2026-05-10T15:07:17Z","title":"From Pixels to Concepts: Do Segmentation Models Understand What They Segment?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T03:12:38.800119Z"},"links":{"cited_paper":"/paper/2505.15435","citing_paper":"/paper/2605.09591"},"observation_digest":"sha256:f757913b340f42ac49b6a0ea48f3005d413650b81b589132bc44913f83c892a6","observation_id":"92a540e8-24c7-4946-8124-959cd2389bb8","resolution":{"observed_at":"2026-05-12T03:16:19.454729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2505.15435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15435","snapshot_observed_at":"2026-06-29T08:33:15.607500Z","title":"Timecausality: Evaluating the causal ability in time dimension for vision language models","venue":null,"work_id":"a5bbc6a7-8486-45d2-98e6-f5c8ec24d426","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2505.15435","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:8789c98da0d4d36bc85a26d84e621fc4f0ad264a11f313c53c0f9fe9b723e664","observation_id":"20fc5d2c-baf9-4347-b98b-1403ac5bea1f","resolution":{"observed_at":"2026-06-29T08:33:15.609088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15435/citation-record","integrity":"/paper/2505.15435/integrity","json":"/paper/2505.15435/citation-record.json","paper":"/paper/2505.15435"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:01.897899Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:01.897899Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:c0ad80988773104ceb7be86e176dd72e25df41117835439113b6093f90b81aa1","observation_id":"4f53eb2c-dbce-4ace-87fb-44ca5f2f7ef8","resolution":{"observed_at":"2026-08-07T15:21:01.897899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:01.996933Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:01.996933Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:90ff6f43225ff8602e2bcb4d35206c6e1010c1bfd4372cc9f9a3337040f3c129","observation_id":"445f09ff-3a76-46d4-958f-f361391417ee","resolution":{"observed_at":"2026-08-07T15:21:01.996933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T15:21:02.062900Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.062900Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:356348eef3c57228674985fa65bef070021731179de8054f9d59bfeebe15d009","observation_id":"ec76e173-e816-46f3-8405-205f991a40d7","resolution":{"observed_at":"2026-08-07T15:21:02.062900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.955467Z","title":null,"venue":null,"work_id":"fb455b50-58eb-4e51-a825-0c5e474dbb56","year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.152467Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:9d4161c29eafd4d21c378cb94a0f53bcf15c768b23e4639c59c0f3507d6b0be9","observation_id":"216d29cd-008f-403e-a699-f42533fd257d","resolution":{"observed_at":"2026-08-07T15:21:11.041649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.744106Z","title":null,"venue":null,"work_id":"0b1ed5c2-9d7d-42df-91ad-60cc8959d183","year":2015},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.218499Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:0a77ae41f97b078aa96345e3e6adaf0e868908bfd5bb8bf47c1d06ff7a5dbae6","observation_id":"82beea28-e0a4-4388-b12e-4125d60ac75f","resolution":{"observed_at":"2026-08-07T15:21:10.849727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T15:21:02.331665Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.331665Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:51a4122dfb75732e671eef6d017c0f7be7ded5a49da5a5c385181cc0cac3cd68","observation_id":"1eeee35d-e988-49da-80b4-e3dd4127d940","resolution":{"observed_at":"2026-08-07T15:21:02.331665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T15:21:02.451677Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.451677Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:3e820c976b777e99970a161814699b0ba2864fff2bc65b5462d29d731e82b8de","observation_id":"84ef2487-92c8-432c-9b13-6db5082652b5","resolution":{"observed_at":"2026-08-07T15:21:02.451677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14378","last_updated":"2025-03-18T16:10:24Z","snapshot_observed_at":"2026-08-07T16:54:31.868932Z","submitted_at":"2025-03-18T16:10:24Z","title":"Impossible Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14378","snapshot_observed_at":"2026-08-07T15:21:02.536850Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.536850Z"},"links":{"cited_paper":"/paper/2503.14378","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:94590886a85c9db3ed6e1ab4a1077dd5bf0d22e324298af5e02d3f1daecdd192","observation_id":"218cf0c3-5a73-418e-bf61-5a4c23ccf024","resolution":{"observed_at":"2026-08-07T15:21:02.536850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T15:21:02.707953Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.707953Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:bc2b657d8b099bfcaed7efca0e16a24466da110f550b279cb381ab41959a7c6c","observation_id":"46e84066-4c31-4f17-98a7-79717af5cf07","resolution":{"observed_at":"2026-08-07T15:21:02.707953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:02.830991Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.830991Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:583838d4bfbc7d4d5e437979f509b450aa3bd16d3eebbd26eb7a6824cb27d19d","observation_id":"b2d305cd-1c1e-4c0b-8c68-62234e14ab57","resolution":{"observed_at":"2026-08-07T15:21:02.830991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.508222Z","title":null,"venue":null,"work_id":"1a6f8490-3aca-4cc0-b8e2-0fcdc9348cc3","year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:02.924684Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:98bcf475144f268d391acae5c277e828fe5e44c1606245d030edb60b00c8424b","observation_id":"7cedd5a6-3b1e-4b0f-a5d5-185d12943e0a","resolution":{"observed_at":"2026-08-07T15:21:10.613925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:03.030057Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.030057Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:8eda4de0f36ae0c0805ce8874277fd71d4e133145c880ffa6f933f8506d0fc52","observation_id":"af172295-76cc-4ba5-bf35-5d5561ae1910","resolution":{"observed_at":"2026-08-07T15:21:03.030057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-07T15:21:03.130746Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.130746Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:c794d7cf2d393df568d111082dbf6c5169b36301d6b6d9d5342fb64e0a37944a","observation_id":"88f38579-9ced-4e65-abcb-f5c8ac69ea40","resolution":{"observed_at":"2026-08-07T15:21:03.130746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T15:21:03.249527Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.249527Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:f26b6f397f892d576312a4c7c6ff40b2c58b2799e62583b64bc7f07f069b580d","observation_id":"640635d4-8ae0-4327-8ef1-241b1eb24b0e","resolution":{"observed_at":"2026-08-07T15:21:03.249527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-07T15:21:03.535519Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.535519Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:af23de2aeca4fe4af51d95fa1688adfb20a451d3f40f8e5f62f84ead691ec920","observation_id":"627fb513-bad7-4ea4-bda2-4b64db0c639f","resolution":{"observed_at":"2026-08-07T15:21:03.535519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.316634Z","title":null,"venue":null,"work_id":"dcc3c998-f5c2-4921-a3fd-de57168bf36e","year":2017},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.649848Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:7717f83f34e5e10a7688f8ae0722826da1ee66ec07ee25c313d889ffac859a28","observation_id":"b7dd6055-5026-4b96-8b03-cb440ab0a84b","resolution":{"observed_at":"2026-08-07T15:21:10.392999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:21:03.788774Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.788774Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:1d609ee028dea545a1ceca73b4fdba7fb73351585db1717028eaa1a48f72becf","observation_id":"f6aec4ef-04ab-44e1-9795-eac64d00109f","resolution":{"observed_at":"2026-08-07T15:21:03.788774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-07T15:21:03.895366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.895366Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:dc51a249c226a5c83c30e261df9eab59ecf0d75f163b2a2e9dcf90642a1252ed","observation_id":"2c8162b7-1d8f-42ab-954f-5ad194dd303f","resolution":{"observed_at":"2026-08-07T15:21:03.895366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T15:21:04.051014Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.051014Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:768935ab983d881f9bfab115e626a723bc468919c92355ce01674d209d580d4c","observation_id":"6425c5f5-2628-4408-8271-946a7a686471","resolution":{"observed_at":"2026-08-07T15:21:04.051014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.085183Z","title":null,"venue":null,"work_id":"3415d569-c298-48e1-ac91-4c8e3bb32538","year":2019},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.163938Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:592b55e2080543d42fc55bdd46c87ea866bbeb5b4534175d6014fe3fd3f04f51","observation_id":"954e36cb-c8dc-4f31-b379-aa5c102e721a","resolution":{"observed_at":"2026-08-07T15:21:10.199942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T15:21:04.260199Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.260199Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:0ff6c7b427359580efb0758061ed0dfd3beb7009da40ba2db54dd141e08a3639","observation_id":"e6fc057c-dfae-4535-b908-ab7a9a896b29","resolution":{"observed_at":"2026-08-07T15:21:04.260199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:09.887019Z","title":null,"venue":null,"work_id":"9795ee43-be29-47b3-a8b4-78380d07d28c","year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.355966Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:ca3f527ef0fffc871876a15a686f740ae917d424e35d294e8895a7ce258f0a95","observation_id":"b8a9cbf2-4eda-4048-8a07-862490b3936a","resolution":{"observed_at":"2026-08-07T15:21:09.969323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T15:21:04.487040Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.487040Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:8174143552912c028211af9e1569614d441a363301b94029e0839b2106ca19e7","observation_id":"056bf031-8874-4873-a489-2bc26aa9f4c4","resolution":{"observed_at":"2026-08-07T15:21:04.487040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00890","last_updated":"2023-06-01T16:50:07Z","snapshot_observed_at":"2026-07-29T15:30:39.490502Z","submitted_at":"2023-06-01T16:50:07Z","title":"LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00890","snapshot_observed_at":"2026-08-07T15:21:04.593542Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.593542Z"},"links":{"cited_paper":"/paper/2306.00890","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:b5086ecd79483c24ce309e31e32ecaf896d48625292fd345abf9ccae1d845661","observation_id":"039e884b-22be-453f-a0e4-4a4d613024a8","resolution":{"observed_at":"2026-08-07T15:21:04.593542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T15:21:04.740070Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.740070Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:1609a977d01368bdc86f1e92b8a3042927faa4d96f376076baf020476af97948","observation_id":"c4e2eb9e-1707-4ee6-8b0d-b25d5b4162f7","resolution":{"observed_at":"2026-08-07T15:21:04.740070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:04.768471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.768471Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:e720f8c5868a0cd7c75cb1712bc682b50d4d474ceeabbfddcc247a73a615423d","observation_id":"44ba6a1e-313f-45b3-b17d-9e3b20c02255","resolution":{"observed_at":"2026-08-07T15:21:04.768471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17404","last_updated":"2024-09-21T14:59:07Z","snapshot_observed_at":"2026-07-06T16:54:14.216770Z","submitted_at":"2023-11-29T07:15:34Z","title":"VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17404","snapshot_observed_at":"2026-08-07T15:21:04.771148Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.771148Z"},"links":{"cited_paper":"/paper/2311.17404","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:604a7b5938017e36adcab500fcce9041169d2e72b39c01d92f6ac50a6e694151","observation_id":"01a14c51-e559-4fa9-a653-a5299ebf00c5","resolution":{"observed_at":"2026-08-07T15:21:04.771148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09788","last_updated":"2024-09-15T16:45:42Z","snapshot_observed_at":"2026-07-06T19:15:38.913862Z","submitted_at":"2024-09-15T16:45:42Z","title":"Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09788","snapshot_observed_at":"2026-08-07T15:21:04.774658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.774658Z"},"links":{"cited_paper":"/paper/2409.09788","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:f9820835ceddd029a79b43036183940252b854059fc35e20163e7781e122b50c","observation_id":"6685021b-79d0-49b0-952d-3f044846202d","resolution":{"observed_at":"2026-08-07T15:21:04.774658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:04.851495Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.851495Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:3d330d06202fc6524bd72ce7e838481ff7e642e71babdacc8035c3dde088558e","observation_id":"2cf8e1f9-7b5c-4f6a-a3ad-37cd939180ec","resolution":{"observed_at":"2026-08-07T15:21:04.851495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:04.947994Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:04.947994Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:fede0b8bca585082d82cc4a6cd28cf12c28dbe822e1cdc248ac933ef7d433db2","observation_id":"d63b1fd5-9a45-46a0-aa97-d76e1dcfb7e6","resolution":{"observed_at":"2026-08-07T15:21:04.947994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T15:21:05.036615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.036615Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:752739e5af02d7a702b5242edc0baa3b356b9f98a7a79d78e419fa0fcbfe86b1","observation_id":"b6dcae9b-d0dc-4923-b60d-f7b60375cf58","resolution":{"observed_at":"2026-08-07T15:21:05.036615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:09.691460Z","title":null,"venue":null,"work_id":"89ffeaac-8b7a-4af9-9964-642e4ff7ef3a","year":2022},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.161689Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:0308d1f54b3fbec23d5f9cbaa79c433c9bdba2b500ee28c0d184e2174e72c011","observation_id":"145cc998-7cf1-4a90-a99a-40d80a77bff8","resolution":{"observed_at":"2026-08-07T15:21:09.788787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:09.442009Z","title":null,"venue":null,"work_id":"243dadd2-fb92-4c99-8fc0-90690e6a7d7b","year":2022},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.246434Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:482a2efa348141442a65f372c93fa505bb12654e49d027daf04e805da2e313da","observation_id":"e2947ecf-9fdf-4ebe-a753-c19a0cae9a71","resolution":{"observed_at":"2026-08-07T15:21:09.612225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08202","last_updated":"2025-03-13T06:09:17Z","snapshot_observed_at":"2026-07-06T19:31:23.072307Z","submitted_at":"2024-10-10T17:59:22Z","title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08202","snapshot_observed_at":"2026-08-07T15:21:05.372302Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.372302Z"},"links":{"cited_paper":"/paper/2410.08202","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:9e22d884e0362645e6d68cfb76dc8ae007fe7816a09ee1e1dc5861986bbdc627","observation_id":"13d25a94-f9e4-46f9-ac01-cb6142da07aa","resolution":{"observed_at":"2026-08-07T15:21:05.372302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-05T15:15:57.768787Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-07T15:21:05.497735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.497735Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:207acecfbb174060b0b81454b3aba20925db92fdfb6cfc4e9ce7272eb0d47912","observation_id":"c9c0aa41-0ace-4d52-82ef-682ec8b0919c","resolution":{"observed_at":"2026-08-07T15:21:05.497735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T15:21:05.685566Z","title":"Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, AJ Ostrow, Akila Welihinda, and Others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.685566Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:879dc243b2b346597be496788552cc5bba40102cc4edd7f6f7ad551d6e886576","observation_id":"0d77b8db-c044-4b64-a8d0-1211e6dffdc6","resolution":{"observed_at":"2026-08-07T15:21:05.685566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:09.210547Z","title":null,"venue":null,"work_id":"ff4c1510-7f57-4d8d-85c8-c0162b8a500e","year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.853733Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:d68e9c7c750b7ad3c55bd2c0b7b1f104960658df8951fdedb77bf83bd9c51371","observation_id":"14412af5-64c2-4158-9c1d-75ba21a59604","resolution":{"observed_at":"2026-08-07T15:21:09.297461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:05.940815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:05.940815Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:a97dc7f28696f16fa4f175ad0b75df09060b1278943dacdc6c77124a74e237a5","observation_id":"e3ba647c-9f9c-434b-ae3b-6306d600074b","resolution":{"observed_at":"2026-08-07T15:21:05.940815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T15:21:06.071552Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:06.071552Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:3699758f9d800a66b1bcf74f44aff8ca5aa16626b234f252277b625353cea497","observation_id":"9d5be64a-5744-4655-9384-60088d952b7c","resolution":{"observed_at":"2026-08-07T15:21:06.071552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:06.267102Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:06.267102Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:c918851b3d7a1f54703a8887a9cd0904e895ee12d7375cd64e7971a7b5d59544","observation_id":"69230039-c42b-44ae-97a2-ba8355cd7fa9","resolution":{"observed_at":"2026-08-07T15:21:06.267102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-07T15:21:06.449932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:06.449932Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:0316366e13d72110bab5f15fbf27a2f0bbd6dee6409d8fbccb0a877ca6642e6e","observation_id":"39ca58c8-aa14-4b82-af06-792237eff944","resolution":{"observed_at":"2026-08-07T15:21:06.449932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:06.641219Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:06.641219Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:cfe3eda377e1ae70c913ea64f5735e5ff1a042ef9fd58478fab76890f9324781","observation_id":"c628ca5d-3a85-40cc-a750-e34bee2d160f","resolution":{"observed_at":"2026-08-07T15:21:06.641219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05091","last_updated":"2024-07-02T12:46:23Z","snapshot_observed_at":"2026-07-06T17:56:53.470829Z","submitted_at":"2024-04-07T22:16:50Z","title":"MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05091","snapshot_observed_at":"2026-08-07T15:21:06.787806Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:06.787806Z"},"links":{"cited_paper":"/paper/2404.05091","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:b689b2c1568a51c87998975822d11693a8322159c65372f6570caa9a836e32c1","observation_id":"c8035537-ae48-42e0-894e-0e6c16c842ce","resolution":{"observed_at":"2026-08-07T15:21:06.787806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T15:21:06.920302Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:06.920302Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:863da44a8cddfc6bbbb6c681f29b0562deb2c64de4cb6bfa4c8b54cbe0bdce3d","observation_id":"8128d2ce-0dd0-4952-8a67-5aa1b8cc6633","resolution":{"observed_at":"2026-08-07T15:21:06.920302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T15:21:07.073488Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.073488Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:dc9f1a9f9aebb21f244d7ddfaf402142230912ed1f361b5eed861f32ee9ce5ba","observation_id":"543de62e-338d-4339-b276-26a66aa69b8a","resolution":{"observed_at":"2026-08-07T15:21:07.073488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T15:21:07.243953Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.243953Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:1236ccafc0b8f94179aa804fd7ce4f18566ac3af5e27afc3b5774f551c57b5de","observation_id":"573f87b1-67c5-4310-a457-7bf36f630d62","resolution":{"observed_at":"2026-08-07T15:21:07.243953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T15:21:07.416688Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.416688Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:baafea66d192b02c76114fc106492dfc94e07c7ea24272618da3815f0c195d4e","observation_id":"cd21bd03-7f4e-4771-9884-933151047622","resolution":{"observed_at":"2026-08-07T15:21:07.416688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:21:07.549870Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.549870Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:12a3f9d98129e6ada8b811adeee1e74799175342453c14ec2adb83c21234b037","observation_id":"37dbdc00-6367-425e-b14a-eee599f99ee6","resolution":{"observed_at":"2026-08-07T15:21:07.549870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:21:07.684945Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.684945Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:3c7bfb1f969a8fd61f03865d6783bab691fe403e2d2c612c888c2a3d39647bf2","observation_id":"5ec21d43-91b3-4b21-9237-23bd9a1de64b","resolution":{"observed_at":"2026-08-07T15:21:07.684945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T15:21:07.899523Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.899523Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:f54ce87b69d8029bed2ce8b45456fcea5507d551d4b71df3db15c5c84fe51809","observation_id":"162343e5-fdec-4c9c-ae9e-583fe6c9d36c","resolution":{"observed_at":"2026-08-07T15:21:07.899523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T15:21:07.985252Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:07.985252Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:51c43c5042c005dbf0e29502db5bdb31008eae4adbb6d9c54ab27ade8b0302fb","observation_id":"b0c334f9-a71c-4719-bc39-c65cc679c070","resolution":{"observed_at":"2026-08-07T15:21:07.985252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:08.918042Z","title":null,"venue":null,"work_id":"8452556d-b28b-4e72-8732-94dfb721f147","year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.048218Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:ae950971c6b7616ec9ad85d911470bec31daaf52a9735ac9e4b07e3e91e44103","observation_id":"e4d64376-76fc-4b58-93b1-2a35352addf5","resolution":{"observed_at":"2026-08-07T15:21:09.049188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:08.112320Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.112320Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:cc1292cbbec7f6b748b39566701895a14f1fb729379774ae51b74d681cf0c00a","observation_id":"dede3df7-5bb3-4c2a-b94a-6c6bf08abb6e","resolution":{"observed_at":"2026-08-07T15:21:08.112320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02414","last_updated":"2023-10-25T05:22:43Z","snapshot_observed_at":"2026-08-02T04:26:53.194797Z","submitted_at":"2022-10-05T17:34:44Z","title":"GLM-130B: An Open Bilingual Pre-trained Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02414","snapshot_observed_at":"2026-08-07T15:21:08.213812Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.213812Z"},"links":{"cited_paper":"/paper/2210.02414","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:e9baab8e20c49ea2c3c454ae1006d6fbaf25d254afb444b7174fed832287534d","observation_id":"b0fcdb82-19b4-4dd5-b49d-b51c72537f1b","resolution":{"observed_at":"2026-08-07T15:21:08.213812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-07T15:21:08.281191Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.281191Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:34928279cf7f156f97457e8c5364d1390de9214c598c045972032ae6e9c925c6","observation_id":"0ac36fb2-ab8f-4be9-878b-df0d6c8add89","resolution":{"observed_at":"2026-08-07T15:21:08.281191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:08.369899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.369899Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:7a9078562b8617db51822acf0f33edbf9c083cb7fbfb4c48f0a5e0b6c9b6e17c","observation_id":"a1a76945-8ea5-4931-b5ae-9afcd0d1d78b","resolution":{"observed_at":"2026-08-07T15:21:08.369899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:08.464980Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.464980Z"},"links":{"citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:0a2b46fb09475ea0ff4f5f6388865f385ec48cd094264e9f54dcf02b8a1411f9","observation_id":"671bbe9c-b429-4adf-8e61-d18d895d741c","resolution":{"observed_at":"2026-08-07T15:21:08.464980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-07-06T19:43:46.557944Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-08-07T15:21:08.559862Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:08.559862Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:1b30be911260d5992ab63bd5a4d5aea33922aaa505684704ed74dae81fe16bd4","observation_id":"5ae7bb7b-10ed-462e-908c-fd816a7b30b4","resolution":{"observed_at":"2026-08-07T15:21:08.559862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 3 inbound Pith citation observations for arXiv:2505.15435."}