Pith. sign in

Paper Citation Record · LEDGER

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models

As of 23 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2505.11326.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.11326 v1

Coverage vector

measured 35 of 35 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:59:44.490450Z

measured 35 of 35 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

35 of 35 outbound references displayed

  • verified exact0
  • verified fuzzy17
  • unresolved18
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 75cc6bdf-361b-4106-9598-db20beabe6fb · outbound

This paper cites Whisperx: Time-accurate speech transcription of long-form audio.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Whisperx: Time-accurate speech transcription of long-form audio

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.303049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.303049Z digest=sha256:8e0f772a001aa1d94746460d98d5f16c0408d718b87be582c0a0671f1cf0a1b2

Observation b1f03ec7-e3b7-4e61-8478-188164d96183 · outbound

This paper cites Can Foundation Models Watch, Talk and Guide You Step by Step to Make a Cake?.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Can Foundation Models Watch, Talk and Guide You Step by Step to Make a Cake?

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.308563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.308563Z digest=sha256:e3e8ca44846d02ac56d6cb7c88162016583a37244c2e8cd53562f2678696ae44

Observation 2f98d959-d7c1-407e-8ec2-e042c4a3f884 · outbound

This paper cites Collecting highly parallel data for paraphrase evaluation.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Collecting highly parallel data for paraphrase evaluation

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:45.161929Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.315951Z digest=sha256:917d23c53d68389250cda168ed2e30c4b1f36ace1b63bd3e51f50024278c3407

Observation ec80b8eb-3278-4975-bb24-63c30c98d033 · outbound

This paper cites Videollm-online: Online video large language model for streaming video.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Videollm-online: Online video large language model for streaming video

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.321146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.321146Z digest=sha256:f0d057f12d56c51f5648fc4412609dbcb905ad7801c1fcf6ec8840fdbffebb68

Observation 21cf206b-517a-4e58-9020-752a3809d13f · outbound

This paper cites Scaling up soccernet with multi-view spatial localization and re-identification.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Scaling up soccernet with multi-view spatial localization and re-identification

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:45.135652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.328136Z digest=sha256:36b20f7345a9a0cedd50574356070ee220ae35bfff6babcf5acd255fba3d4602

Observation fe29c422-2803-4947-9b12-29889e1c19d5 · outbound

This paper cites Soccernet-v2: A dataset and benchmarks for holistic understanding of broadcast soccer videos.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Soccernet-v2: A dataset and benchmarks for holistic understanding of broadcast soccer videos

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:45.117010Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.333812Z digest=sha256:412fe5762c1cdaddfe1a45e2bf7cd470b54d8e148b86a406c0c57039af4b9f77

Observation 7232378e-932c-4555-aab4-93690da115c0 · outbound

This paper cites Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.340813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.340813Z digest=sha256:2183de068b27e3ab08a52810a54f60ac4f3f7664fe636c03c3da368999a8b069

Observation b6849114-f0f8-4624-ba96-25c03349e43d · outbound

This paper cites Lora: Low-rank adaptation of large language models.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Lora: Low-rank adaptation of large language models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.347079Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.347079Z digest=sha256:58621d2c3865ef04917719ab9bc28eb0d4377b47182486b2dedbbd2d15813783

Observation 1ab8fa84-8620-4326-a328-c5bc05163bfa · outbound

This paper cites Tgif-qa: Toward spatio-temporal reasoning in visual question answering.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Tgif-qa: Toward spatio-temporal reasoning in visual question answering

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.351745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.351745Z digest=sha256:c566663cce971dfe3826682c3924736c7a43b9e8a877b0af042f0c48ad5394bc

Observation 8dc99ae8-e853-4700-ba2d-df6efd0f2259 · outbound

This paper cites The Kinetics Human Action Video Dataset.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models The Kinetics Human Action Video Dataset

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.356501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.356501Z digest=sha256:e36e9e36544ab6811daa48eb75ef537c06b2b7bb1f3eeb1fca7dd5aa9fbe675f

Observation 1c910d08-713e-4632-b3a9-38aacb82405e · outbound

This paper cites Kuehne, H.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Kuehne, H

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.362667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.362667Z digest=sha256:a9d5c5cd99f52392f7e67b1d6efe61ddae23401dc7c79e0668ef115098fd2cac

Observation 61f983df-8579-40c0-badd-30d8c695e420 · outbound

This paper cites Revealing single frame bias for video-and-language learning.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Revealing single frame bias for video-and-language learning

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:45.067562Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.367653Z digest=sha256:eb7f030dfdd06a61d7d0c9ded7791a2d078c80e0eeeb80984e8d79c7ec1cd9ac

Observation d7a362db-5f54-4548-b73e-99ceb56abe63 · outbound

This paper cites StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.373465Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.373465Z digest=sha256:a58870df0d6926a4ecd18656429343f02d502bde0f6155d778074c9c6fd1bfe9

Observation f7a941e4-affd-461e-ba72-7bc96ba969f5 · outbound

This paper cites Video-ChatGPT: Towards detailed video understanding via large vision and language models.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Video-ChatGPT: Towards detailed video understanding via large vision and language models

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:45.050166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.378910Z digest=sha256:337217259f0b2938e20ccf669dab632953f069c163c24f62c5941d1fa675da5f

Observation c723c2a4-4c43-482c-9f4b-a56295a245a5 · outbound

This paper cites Egoschema: A diagnostic benchmark for very long-form video language understanding.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Egoschema: A diagnostic benchmark for very long-form video language understanding

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.383853Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.383853Z digest=sha256:0691e81ec5026c3921fe1382d3f35269e628ff3c356215fbb2e2a3bd3126cde8

Observation d797e867-3737-451a-b6b2-bfb6ac20aec2 · outbound

This paper cites Sentence-bert: Sentence embeddings using siamese bert- networks.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Sentence-bert: Sentence embeddings using siamese bert- networks

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.389000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.389000Z digest=sha256:e6935da88a7bc6b899b88dc0e54c3154bd4f1898d386bf224bf2ca3afd6a0638

Observation 8b4620d1-88e6-470b-95ea-b89dcbff0d32 · outbound

This paper cites Ego4d goal-step: Toward hierarchical understanding of procedural activities.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Ego4d goal-step: Toward hierarchical understanding of procedural activities

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:45.007211Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.393797Z digest=sha256:faf918285033f37dd412176c45a4b088a6efabe0cf66eb9d3873ba9616edfc5e

Observation 26f36893-dc16-4247-8980-214f94fc6d29 · outbound

This paper cites UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.398445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.398445Z digest=sha256:8ebf8f985f11abe744820d6e59481f9fba35ec6d1773bbd54ed9eaafc39dc530

Observation ff7c91f7-c8bc-4515-9515-da0647bdb275 · outbound

This paper cites LVBench: An Extreme Long Video Understanding Benchmark.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models LVBench: An Extreme Long Video Understanding Benchmark

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.403939Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.403939Z digest=sha256:19f732ead777ac0a577dc412dba39af3ace8c9c7233c8dea9fd9bc45a25c6f44

Observation 2fbeb405-5b44-461d-a139-de0c6372cb3e · outbound

This paper cites Holoassist: an egocentric human interaction dataset for interactive ai assistants in the real world.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Holoassist: an egocentric human interaction dataset for interactive ai assistants in the real world

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.408719Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.408719Z digest=sha256:38fb159ea058998531fd6ceb3ad34a2a6d97ae98d94a5087902fb10fd07d0f6c

Observation 563f63b5-921f-4b96-827e-5d52e4954507 · outbound

This paper cites Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.414305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.414305Z digest=sha256:d226118f9c4ee9010a06c8e2a69d68593938fb7c4e2a79eee1d3b628094dd967

Observation 78c0ae33-b22c-4b93-ac37-f72554f67797 · outbound

This paper cites Video question answering via gradually refined attention over appearance and motion.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Video question answering via gradually refined attention over appearance and motion

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:44.979142Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.419466Z digest=sha256:5ccb2b5dc21db39cccf774946c2cf8959751cab580265a9f27f25cdec52b3038

Observation 4aae3c04-e1d7-4d26-8935-6e9bb160baa2 · outbound

This paper cites Msr-vtt: A large video description dataset for bridging video and language.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Msr-vtt: A large video description dataset for bridging video and language

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:44.960293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.424084Z digest=sha256:efc9ea7dc4e01705fa32a3c6ee4670bb7a395b35162956430e605727a07d0c56

Observation 6854d76f-e17e-4701-949b-73fa9386dad4 · outbound

This paper cites Svbench: A benchmark with temporal multi-turn dialogues for streaming video understanding.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Svbench: A benchmark with temporal multi-turn dialogues for streaming video understanding

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.429413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.429413Z digest=sha256:72da2fdbce003943852a6dab0ab3651918e86650738fd33c27000ec469bb08f4

Observation 4187126b-7494-40be-bdfb-29e760759ba6 · outbound

This paper cites Eliciting in-context learning in vision-language models for videos through curated data distributional properties.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Eliciting in-context learning in vision-language models for videos through curated data distributional properties

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:44.943839Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.434797Z digest=sha256:1196f68df08103c4e4b38745aaee16d92e2f811bb01db04b90138a80fcd6a34c

Observation d8794ff5-f4a5-4c5e-a1fd-1b8f530ed218 · outbound

This paper cites Activitynet-qa: A dataset for understanding complex web videos via question answering.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Activitynet-qa: A dataset for understanding complex web videos via question answering

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:44.924842Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.439748Z digest=sha256:0d8ce4a08a03ba1e6b1acb8692bb5b47f2d5b6db4c959fbb6449b94d8d006bb6

Observation 72b39727-9394-4d29-a9f6-046ca197b88b · outbound

This paper cites Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.444257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.444257Z digest=sha256:da4c0defdbaad6c149492795357d205f5ce86ab8b9f899be1b300daac1de727a

Observation 24d01f6e-a1e8-46ca-b135-c1b904cdd358 · outbound

This paper cites MLVU: Benchmarking Multi-task Long Video Understanding.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models MLVU: Benchmarking Multi-task Long Video Understanding

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:44.449130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:44.449130Z digest=sha256:204aaad5270ea47fcdec17f28f77963ada0191567d126880861e9f0e45c7fa29

Observation ccfdbc82-a9f5-4d8c-a563-a0de92771cbb · outbound

This paper cites Streaming dense video captioning.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Streaming dense video captioning

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:44.906573Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.455082Z digest=sha256:fece0bc69456ecaf46a1cc4f732926068737d609dd03d67e76b0cddb10092091

Observation 819f5db5-769b-4bb4-b26e-1449ad8caa05 · outbound

This paper cites Streaming dense video captioning.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Streaming dense video captioning

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:44.889502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.460725Z digest=sha256:d042de8233fdbfcdc0f4781cf3c9a366c42efac6b44a667623188f5fc3dd29f0

Observation f3643ec8-d4c5-4917-bc67-5acdd74abe71 · outbound

This paper cites Assistant: Now remove the indicated component that’s damaged,.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Assistant: Now remove the indicated component that’s damaged,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:44.871347Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.466891Z digest=sha256:50ca8923a2a276ae79dbb9e56dc8ae4bcc6c566a6a21b75b8d8896041c7f5765

Observation 2cfa6a8a-4c17-49a7-aa41-814f6dd7ccb3 · outbound

This paper cites User: Oh, this thing?.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models User: Oh, this thing?

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:44.855193Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.473863Z digest=sha256:06d3cda0cdde7bc7714b464ecd91d81444f4fb1e479c4c140488352ca3a63421

Observation 54a7b08f-9c91-48d5-b906-b79e2f593a37 · outbound

This paper cites Assistant: To the right.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Assistant: To the right

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:44.836564Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.479794Z digest=sha256:a7580f65396194c531b457c7f412b1f73dd40d5b9169c43c5a7d6661c3088b3d

Observation d68f24af-eb19-486d-80b3-4a095169399a · outbound

This paper cites Assistant: The small cube.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Assistant: The small cube

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:44.818262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.485009Z digest=sha256:9f4b9eaa9e0e15a06fb7386e0c14ffc824040b4448bd894cb94937d04bbed50f

Observation 257df93b-1121-4904-89de-6ab1c86d47d6 · outbound

This paper cites Assistant: Yes.

Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models Assistant: Yes

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:44.799748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T20:59:44.490450Z digest=sha256:283fa27694361e9dbcf8b5a8394157430c119f29560da7a13e0e5797ab37be3b

Pith citing papers

No inbound Pith citation observations are available.