{"as_of":"2026-08-08T09:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ccd2cb56ddfd9711ef8753bf67170080f7157062d72455fbd01ce6d159715037","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:06:25.327098Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T21:20:00.041277Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.379714Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2508.13470","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13470","snapshot_observed_at":"2026-07-03T21:28:58.379714Z","title":null,"venue":null,"work_id":"43bf5bf4-ad30-46ed-b9a7-a7bfe57f652b","year":2025},"citing_paper":{"arxiv_id":"2607.02089","last_updated":"2026-07-01T14:25:43Z","snapshot_observed_at":"2026-08-02T16:57:02.105465Z","submitted_at":"2026-07-01T14:25:43Z","title":"ESC: Emotional Self-Correction for Reliable Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-03T21:20:00.041277Z"},"links":{"cited_paper":"/paper/2508.13470","citing_paper":"/paper/2607.02089"},"observation_digest":"sha256:e7260b6fdec32495f5bef535e2c55303863cd8ca576da67de4f7296afd824c8e","observation_id":"ca2de7d7-d1d7-4c89-9448-115a09479bea","resolution":{"observed_at":"2026-07-03T21:28:58.381307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.13470/citation-record","integrity":"/paper/2508.13470/integrity","json":"/paper/2508.13470/citation-record.json","paper":"/paper/2508.13470"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T19:06:22.867967Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:22.867967Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:854de3123237feb5119d97b86c73548b13cfe1eb9d6e9478b17a3e6d45b3059a","observation_id":"a1ccbd97-d541-4f94-8c02-1e42ddfd6af8","resolution":{"observed_at":"2026-08-05T19:06:22.867967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:29.575633Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":"d7e01987-28cf-45dd-9297-c040dfbe948a","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:22.954759Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:2158496be83458b20406c6045b08f7439f6da9a9aee9b65c4fac3aa9b956df68","observation_id":"273c710f-7f77-4bba-87e7-804e49fe16e2","resolution":{"observed_at":"2026-08-05T19:06:29.641597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:29.405080Z","title":"Maplm: A real-world large-scale vision-language benchmark for map and traffic scene un- derstanding","venue":null,"work_id":"dd0bc416-91c4-47e6-875e-c992e9299e33","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.004322Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:1c195f8aa4c73ae82aed077b65c5f441e3497f3676e0367bb97be805b8b8df1b","observation_id":"2ee33d05-da6e-4be0-89fc-4f0f0d3a715c","resolution":{"observed_at":"2026-08-05T19:06:29.503846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:29.270322Z","title":"Cityllava: Efficient fine- tuning for vlms in city scenario","venue":null,"work_id":"8f17a6fd-f90f-419a-88cb-24bb7bec7b07","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.047424Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:8ef361d8125c62bd35f7e295f136d31c3a697e7cfa189fb0c9abd33b0b3f0582","observation_id":"afc6916c-e97f-43e6-b66b-f4a376c76f49","resolution":{"observed_at":"2026-08-05T19:06:29.338854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:29.146642Z","title":"Cityllava: Efficient fine-tuning for vlms in city scenario","venue":null,"work_id":"8eb47230-72b5-4a9f-a64d-c5d637496a56","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.121343Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:db4644a55c7cb78dbd7e2e909e309eaa0631a8d10740859e2068f04986e77141","observation_id":"97a332a3-6fda-4503-ab1c-039cbffc7f9f","resolution":{"observed_at":"2026-08-05T19:06:29.215166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.985635Z","title":"Optimal gradient checkpoint search for arbitrary computation graphs","venue":null,"work_id":"84af50e6-d7c6-46c3-9266-c2f3780a9e6c","year":2021},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.188507Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:9d47bb7a3794214cff367e326ae3e5a42cce93e586feb823adc92432f56df07f","observation_id":"683612bf-d7a1-485c-b5c1-8417c7c23426","resolution":{"observed_at":"2026-08-05T19:06:29.085557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.809411Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"1e7e9039-bdcd-4bee-8650-42be0953ab04","year":2022},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.240284Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:d9e344fa0d4bbe020f3efc5b499fe16a6d1ca54eb002d704a64390bd46b6fbd2","observation_id":"73c536d8-c260-472d-896d-4d0875328523","resolution":{"observed_at":"2026-08-05T19:06:28.871406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.663235Z","title":"Better zero-shot reasoning with role-play prompting, 2024","venue":null,"work_id":"f6f90c93-7785-414f-ad2a-1b55f158544d","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.340402Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:db966de84dbad9573a21121299f5fe7284b854dd2f43dcaba5db1db4c6ef29d1","observation_id":"cc28c621-9006-4e38-b4a2-a4e01cc313bb","resolution":{"observed_at":"2026-08-05T19:06:28.728846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.488490Z","title":"Wts: A pedestrian-centric traffic video dataset for fine-grained spatial-temporal understand- ing","venue":null,"work_id":"ee246226-0b69-4f2b-9df1-7ae28446fee2","year":null},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.441211Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:0fbeb53e0526628d2831c047ce6ec2165869198d085bdb3dec680e39b53a7318","observation_id":"18c180c3-c576-499b-b6df-f33e92a77418","resolution":{"observed_at":"2026-08-05T19:06:28.580566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","snapshot_observed_at":"2026-08-06T03:07:46.739669Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08282","snapshot_observed_at":"2026-08-05T19:06:23.616871Z","title":"Llava-st: A multimodal large language model for fine-grained spatial- temporal understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.616871Z"},"links":{"cited_paper":"/paper/2501.08282","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:cda5e77def86984dbcc75ce0e62b921bafd9f853c9d8c0f33f78fc110c7ee89e","observation_id":"323ef9e9-47cc-41dc-8691-b32fc052179e","resolution":{"observed_at":"2026-08-05T19:06:23.616871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12589","last_updated":"2025-05-19T00:57:04Z","snapshot_observed_at":"2026-08-07T15:43:34.450000Z","submitted_at":"2025-05-19T00:57:04Z","title":"SurveillanceVQA-589K: A Benchmark for Comprehensive Surveillance Video-Language Understanding with Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12589","snapshot_observed_at":"2026-08-05T19:06:23.701939Z","title":"Surveillancevqa-589k: A benchmark for comprehensive surveillance video-language understanding with large mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.701939Z"},"links":{"cited_paper":"/paper/2505.12589","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:1ca400fd280c89b197d639a2a1fd13d60e4302a6c9352df6ca06a780b9115a62","observation_id":"4b115999-15e5-4575-8c98-d5ceb4a12853","resolution":{"observed_at":"2026-08-05T19:06:23.701939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.208481Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"c009b427-3bce-48ab-80b0-0fb4fda5bf2a","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.781156Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:48ae49950d34df2e6c31fc8acdf6fab022c8b4526ad232a8af22292ace0f496a","observation_id":"56de8027-29a1-481e-8680-aa6ead3cb860","resolution":{"observed_at":"2026-08-05T19:06:28.256587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:23.857493Z","title":"Improving generalization in visual reasoning via self-ensemble, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.857493Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:ff7aa39d4d8ebad3c351881fa633c84343e5f72b848a6c5810fe82bc8d5d270d","observation_id":"7f6b4a87-5206-469f-9fef-79ed1d70dd9d","resolution":{"observed_at":"2026-08-05T19:06:23.857493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.019564Z","title":"Hybrid, unified and itera- tive: A novel framework for text-based person anomaly re- trieval","venue":null,"work_id":"129e6702-048c-4499-99a6-622f1492e220","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.920763Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:45c850c584c236b5c0154f1fd42980d1cab41687d3bebef5fdaaf8a7c103a777","observation_id":"6fd23e2d-cd9c-40d0-9a4d-56cb10567450","resolution":{"observed_at":"2026-08-05T19:06:28.124916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:27.862872Z","title":"Le, and Quang-Vinh Dinh","venue":null,"work_id":"6016965d-b07a-4d49-bc1d-aa9175ea235d","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.979582Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:de1b4029b6a1fbfcb931e78615c43a7c1b3ed0d3bb5326e62e6a1a62532e26a1","observation_id":"a6764805-6aa6-4800-b0fd-0c01c7d9b09c","resolution":{"observed_at":"2026-08-05T19:06:27.921115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:27.758456Z","title":"Gpt-4v(ision)","venue":null,"work_id":"2c25df04-108f-4a70-b3d0-0cdb27918150","year":2023},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.016832Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:fa51e2de523af8d04b0e09c4255fd25e5f1c41e89dadf2b8bcd6455e6c511e59","observation_id":"87a592ff-d671-481f-8425-e07c624a32d4","resolution":{"observed_at":"2026-08-05T19:06:27.797475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:27.589335Z","title":"Roadsocial: A diverse videoqa dataset and benchmark for road event understanding from so- cial video narratives","venue":null,"work_id":"eb87fe32-9add-49cd-8b39-f588f56d4ec3","year":null},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.075072Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:f3b404797484d0f3bd29daa3dc76579333984cb51688c5bd28d6753f013554dd","observation_id":"b69b4d08-62d1-41bc-95b4-b66e6049efc0","resolution":{"observed_at":"2026-08-05T19:06:27.678940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:28.344545Z","title":"1, 2, 3, 5","venue":null,"work_id":"d423d619-f97a-496f-a7c7-a7fe1b8b1799","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:23.527136Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:ec88f8ea8fa6cfb221c84834089f02069e2b861c0f26214a72abb80be40ce7c1","observation_id":"5b6bc513-0163-4956-85fc-894ebf82f210","resolution":{"observed_at":"2026-08-05T19:06:28.401999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:27.455731Z","title":"Safeplug: Empow- ering multimodal llms with pixel-level insight and temporal grounding for traffic accident understanding, 2025","venue":null,"work_id":"3250168e-7f3d-4489-8822-50b06716eed3","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.137473Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:57b2510182a80f522a2ef2cc317351070951fcb0d7014f5aaff04db1308e35af","observation_id":"6f9b1c7d-cf42-4e37-a67e-0d548291fcac","resolution":{"observed_at":"2026-08-05T19:06:27.509429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:27.266491Z","title":"Scvlm: Enhancing vision-language model for safety-critical event understanding, 2025","venue":null,"work_id":"8159aff5-6505-497e-8347-f5ec715b1a3f","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.221004Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:880c65db8c55c16fd79b46738e1278f4d3ba9efdfdfde0a5408c1ab3d7478a93","observation_id":"6184360f-bbac-4af5-ab0c-a8d93fdd0657","resolution":{"observed_at":"2026-08-05T19:06:27.365440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:27.095814Z","title":"What does clip know about a red circle? vi- sual prompt engineering for vlms","venue":null,"work_id":"7af6b372-bcdb-47de-bc15-ad0fe68fca29","year":2023},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.286445Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:e6571cf4333b8166168a93f6f95421262d91aa0db25020386454e53cec789874","observation_id":"84a8b82a-efdc-4e8e-b6b4-d69547a4cf23","resolution":{"observed_at":"2026-08-05T19:06:27.181553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.894264Z","title":"Le, and Quang- Vinh Dinh","venue":null,"work_id":"9e6e2606-425e-4c66-801a-ef1a000f6f8d","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.346433Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:693e94306099392dc97a66ac814b7d4ddbfbdee51de5cdaa6a4c498d2b899952","observation_id":"7fed3d03-dbc0-40ed-b51f-eec4ec332711","resolution":{"observed_at":"2026-08-05T19:06:26.981603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.757561Z","title":"Accidentgpt: A v2x environmental perception multi-modal large model for acci- dent analysis and prevention","venue":null,"work_id":"6393c298-72b1-4ca0-9549-65ceccaf6a02","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.381382Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:3e81e5adfc86c5a169070e6b5a2d5f5e592e18895960d89e38337533a1c65691","observation_id":"8977a4f4-d9bc-4267-9041-e6ab6ab98974","resolution":{"observed_at":"2026-08-05T19:06:26.832408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.614076Z","title":"Anastasiu, Zheng Tang, Ming- Ching Chang, Yue Yao, Liang Zheng, Mohammed Shaiqur Rahman, Meenakshi S","venue":null,"work_id":"1226b92f-cbb9-4e52-a118-057c0997a731","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.470008Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:ec49a2d625581f9c25f8da336f65a14b5521f2a0410ec58189c9a088523f3541","observation_id":"0cf37018-ff54-4d37-8b33-bd3c090bbe75","resolution":{"observed_at":"2026-08-05T19:06:26.668464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.444626Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":"de84572e-d677-47c8-9158-b9a4bb5d6808","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.572649Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:fd1be9c4848dc5a24ab7ee4182a495bae68190e3da3b882e906a4c5aa2c46558","observation_id":"23da6946-b704-42ff-8433-1fadd6fe12e4","resolution":{"observed_at":"2026-08-05T19:06:26.496382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.345167Z","title":"SUTD-TrafficQA: A Ques- tion Answering Benchmark and an Efficient Network for Video Reasoning Over Traffic Events","venue":null,"work_id":"a0e2d74f-c855-4a7d-90e0-5d27258de90a","year":2021},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.632142Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:a1cd838e196fe0643fab7f1d14d4770ad182ddef70f111a9487c3bbe0554b8b5","observation_id":"ebbe07ed-b501-4724-9d36-7ff24729e2b8","resolution":{"observed_at":"2026-08-05T19:06:26.379777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.188376Z","title":"Di- vide and conquer boosting for enhanced traffic safety de- scription and analysis with large vision language model","venue":null,"work_id":"e0e1a889-09c4-46ca-94ac-58e073e0b8f6","year":2024},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.730131Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:bc2f24cbdea9dc4413f3fc0dddbd0f9e782ff78a49b95159a9f213eaf7deef6c","observation_id":"117f22c4-c441-4ad8-9258-a6695f8841c0","resolution":{"observed_at":"2026-08-05T19:06:26.263756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11797","last_updated":"2022-05-20T07:05:41Z","snapshot_observed_at":"2026-08-04T19:38:41.223197Z","submitted_at":"2021-09-24T08:07:29Z","title":"CPT: Colorful Prompt Tuning for Pre-trained Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2109.11797","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.11797","snapshot_observed_at":"2026-08-05T19:06:25.690508Z","title":"CPT: Colorful Prompt Tuning for Pre-trained Vision-Language Models","venue":"cs.CV","work_id":"7331241b-8e1c-424c-8a6b-05b2fec5680c","year":2021},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.791229Z"},"links":{"cited_paper":"/paper/2109.11797","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:c6c4dbf4a11269980ac29ce2d1f74e01d08003a6510b9204242e32edbabd084e","observation_id":"688e393a-b896-4e19-b5df-d7386dda7b8a","resolution":{"observed_at":"2026-08-05T19:06:25.771980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:26.028876Z","title":"Bdd100k: A diverse driving dataset for heterogeneous multitask learning","venue":null,"work_id":"4b3641df-f42e-43c6-8038-1e23f7f325b1","year":null},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.856071Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:cf9372c543afdc090c1691b00a6fb32cb9cbcd6bfe49189b2494383d53865343","observation_id":"ea8fc92d-7dbb-49f8-9275-9a6d9b86247a","resolution":{"observed_at":"2026-08-05T19:06:26.105600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02520","last_updated":"2023-07-15T06:45:20Z","snapshot_observed_at":"2026-08-03T11:41:24.252271Z","submitted_at":"2023-06-05T01:01:12Z","title":"A Study of Situational Reasoning for Traffic Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02520","snapshot_observed_at":"2026-08-05T19:06:24.973033Z","title":"A study of sit- uational reasoning for traffic understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:24.973033Z"},"links":{"cited_paper":"/paper/2306.02520","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:b5ba0d5fef16edc1b30047edf47bea93f2942e48aadda4cfee5f4cfa8dc7d91d","observation_id":"84d2afda-c73a-4913-a5ae-9c33b2006d0b","resolution":{"observed_at":"2026-08-05T19:06:24.973033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10604","last_updated":"2025-01-17T23:35:34Z","snapshot_observed_at":"2026-08-06T18:15:19.361212Z","submitted_at":"2025-01-17T23:35:34Z","title":"When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10604","snapshot_observed_at":"2026-08-05T19:06:25.069634Z","title":"When language and vi- sion meet road safety: leveraging multimodal large lan- guage models for video-based traffic accident analysis.arXiv preprint arXiv:2501.10604, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:25.069634Z"},"links":{"cited_paper":"/paper/2501.10604","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:a3816085024125c16083c961b1bebae6796c0f3e6f4d995978fef3816b7cc779","observation_id":"b0cbf26b-8b6a-47ac-92ab-18eea1b1bb09","resolution":{"observed_at":"2026-08-05T19:06:25.069634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07853","last_updated":"2025-05-08T00:23:18Z","snapshot_observed_at":"2026-08-07T15:48:58.609424Z","submitted_at":"2025-05-08T00:23:18Z","title":"CrashSage: A Large Language Model-Centered Framework for Contextual and Interpretable Traffic Crash Analysis","version":1},"cited_work":{"arxiv_id":"2505.07853","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07853","snapshot_observed_at":"2026-08-05T19:06:25.457629Z","title":"CrashSage: A Large Language Model-Centered Framework for Contextual and Interpretable Traffic Crash Analysis","venue":"cs.CL","work_id":"3686e3af-012e-45a5-9dca-7f136dc8510f","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:25.134699Z"},"links":{"cited_paper":"/paper/2505.07853","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:e01481390f9d44ab74a131e12ec873425e4ec8fbfee4f689cfd9a0df9331f428","observation_id":"41fe9ed6-f67d-4514-a3ac-efed3ca5e00f","resolution":{"observed_at":"2026-08-05T19:06:25.539818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02449","last_updated":"2025-02-04T16:14:40Z","snapshot_observed_at":"2026-08-05T02:20:42.322986Z","submitted_at":"2025-02-04T16:14:40Z","title":"TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02449","snapshot_observed_at":"2026-08-05T19:06:25.219559Z","title":"Tumtraffic-videoqa: A benchmark for unified spatio- temporal video understanding in traffic scenes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:25.219559Z"},"links":{"cited_paper":"/paper/2502.02449","citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:2a5e8f73a933023553af3b47852d31fdd8ac3bfcba14eda765f6054a91cf49b9","observation_id":"e66332e3-e7c8-49e4-b33e-672f422eade7","resolution":{"observed_at":"2026-08-05T19:06:25.219559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:06:25.868613Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":"c771c451-1a7e-420f-827b-b06d537b1447","year":2025},"citing_paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:25.327098Z"},"links":{"citing_paper":"/paper/2508.13470"},"observation_digest":"sha256:503fb38e2fe390a6923c5fa15daaeb576ab83c3d526f34fc397152c1af00effd","observation_id":"3610eae5-e259-4029-b6d7-b2658d72b531","resolution":{"observed_at":"2026-08-05T19:06:25.927402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.13470","last_updated":"2025-08-19T03:03:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T19:06:03.891544Z","submitted_at":"2025-08-19T03:03:29Z","title":"STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2508.13470."}