Pith. sign in

Paper Citation Record · LEDGER

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.04302.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.04302 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T20:16:34.534847Z

measured 44 of 44 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

44 of 44 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved41
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 90e525e9-c911-4328-8b70-a47174a6dd66 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.384643Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.384643Z digest=sha256:784cde4c368459f4aa0239ece19577a1f38441bf89ce2735d0ff8c68a50051ae

Observation 4e682979-f303-4655-b98c-24f72a54a037 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.388393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.388393Z digest=sha256:5c5d866e15fbd8fac641a76427813048315b1904e792863451e083f3e859039e

Observation 0f2bfdb1-5068-4b29-be5b-870da079cc2d · outbound

This paper cites Chen and William B.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Chen and William B

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T20:16:35.104578Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.391706Z digest=sha256:f5d73083cc7e665b2dd938d62917d0ba4106a984303853595d9202ddad54242b

Observation a7d1e4bd-17d0-4489-930c-6456b1bfe081 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.095184Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.395440Z digest=sha256:eb8e994408f2b6aaf5b774e9095706341f6e9b52a0ab7f702233493db42e923b

Observation 2970c550-7d5a-40d3-af60-fceb9b8a81b4 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.086217Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.399584Z digest=sha256:4898d8ea6cdd2e0a64ed2119b0572f77a1b488feb2eb11a98c9108d0a60356ab

Observation 1582c9de-4f47-4d4a-8780-68c4ea6c95a6 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.076467Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.402917Z digest=sha256:8588c2a0ab1a2cbbdc28b38c70d7b6ff4b2a7e6e8c0a87179cbc83ce4c0b2450

Observation a3f21455-f719-443b-b591-f809e8fcb211 · outbound

This paper cites Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.407013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.407013Z digest=sha256:1dbaa08dcf586847d36cfb6ef61845eb298ce9726ba2446734657b8272fe46cb

Observation 753642d1-50af-464c-bab4-1dbbf9911e8d · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.067015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.410609Z digest=sha256:6cb02aee2ce56bcd95cb4b9b68c11ecc2a7aed442629c1afa726792f20e12624

Observation 4e8b7751-3cab-4e9c-99a7-fcdc69b33bf6 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.057546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.413771Z digest=sha256:9f7c3fe542e4d077530454797d37ddfd9e6b54be72db5c97b3fe2a71471e8366

Observation 8a56f043-1a1d-424c-b117-8fd3bc998e03 · outbound

This paper cites KaLM-Embedding: Superior Training Data Brings A Stronger Embedding Model.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models KaLM-Embedding: Superior Training Data Brings A Stronger Embedding Model

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.420783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.420783Z digest=sha256:acc9f0ccde33179ce4fb5296ff025f8737901170c80705308050e0c0471c10d3

Observation 62aedf90-4082-49ee-a8cf-ed397a9707f1 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.038685Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.424459Z digest=sha256:6b7d5c3ef2305651c56d1ec716dd353eee9db0363831be919db6d119bb0ee486

Observation 019bf947-3c2d-4f9a-a848-4d6e6bd4dfc0 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.028386Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.428250Z digest=sha256:8fb07c5044c05deb0415ec3d4c914c3a7981647b9a374f1d5ba4a97889c97366

Observation d71e7e95-8a7d-4cc2-b0a1-5d27b15878c0 · outbound

This paper cites NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.431149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.431149Z digest=sha256:1e0bc095f277d77b33407fc1939be2a58eea76705e5c7fcea948fd2b88943dee

Observation 3831fa8c-bf59-40f4-8171-172052cb4d29 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.018077Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.434606Z digest=sha256:9d94c1fa92061017c7184f61836b43b5b1fa0624f95d4df0fe094a7876b2b60e

Observation 7bad7fbf-c2d1-4e61-9f9f-4fdd4728a3ee · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models VideoChat: Chat-Centric Video Understanding

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.437738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.437738Z digest=sha256:c2129a1f2ddaba69cf561efb9f6c60a412a2b28fb70834e9d71ba2ea0eadf57d

Observation a617dda4-f763-4c75-84bd-f36af7609cbb · outbound

This paper cites MVBench: A Comprehensive Multi-modal Video Understanding Benchmark.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models MVBench: A Comprehensive Multi-modal Video Understanding Benchmark

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.442248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.442248Z digest=sha256:689cc91b59884f1157d2c936f304701f280ec908fac84377414130f91cd37d12

Observation c2dd8dab-8c8d-41b1-a819-aae22ea875c6 · outbound

This paper cites Towards General Text Embeddings with Multi-stage Contrastive Learning.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Towards General Text Embeddings with Multi-stage Contrastive Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.445759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.445759Z digest=sha256:8b13d1463500af5cc1053d70ef5ab7b77cc6fe2b2794a5d68b6fd42b5d03f8ee

Observation 889c4ed5-d568-4b95-9361-65fcc4896386 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.449441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.449441Z digest=sha256:b21209d12d05fa7ca82a79d18964bc0c1a72dc8c4e644e3aac9adf96dec9938f

Observation b467bf61-ccd9-4622-bc0d-5a605a726cc7 · outbound

This paper cites G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.452692Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.452692Z digest=sha256:8ef313a00a5000ac127cca8506c878fc43bb83231a9881396c49d075d7a7fa20

Observation c1a17fd2-de85-469d-80e4-623e86192b12 · outbound

This paper cites MTEB: Massive Text Embedding Benchmark.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models MTEB: Massive Text Embedding Benchmark

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.456111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.456111Z digest=sha256:9e55219839cce0d23952af42be3d0176cf5b14c83e5432d1bf1f823199bce17b

Observation 507ddfc6-018c-4dad-a926-47cd89f360e5 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.002669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.459488Z digest=sha256:f5035293ff54d29330eaf732fc926ce667b04ed244eecd51b33b58733c7e8757

Observation 8e850048-92e3-4996-93b0-6887b42a6d0d · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.992472Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.462356Z digest=sha256:73a2cb713a55dadc79012427bd33ad394520ef594fe83e592e02f472fb487d5c

Observation b69efeb4-e38f-409a-9cd4-4175dc29d9cc · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.982682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.465238Z digest=sha256:d1034f3a644e34f8546a9b474be5d69bb297353e0bc97d8bd4f99fb9328d4348

Observation a96b9b52-63ca-4bae-a291-4e8dc2f7bad5 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.973646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.468308Z digest=sha256:0ea316a369abd84c3bff96d5593dfd6cf4943167624fffc8f5e94b23acaaa8a8

Observation 8c17c894-8ce3-49cd-8f47-08d5f941c46d · outbound

This paper cites LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.471457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.471457Z digest=sha256:ee7d2a3263857ebe8c5f73a131020e679f309d13e6263d218b3595cc91ab4b45

Observation 771885ca-b742-45d0-a498-9af0ca2f7ee1 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.964283Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.474698Z digest=sha256:95c60770031ee5ff203dbaba171b39114b1b59c32aa13bb7fba23b935eb20de4

Observation 73fa8f2e-070a-432e-8175-c93a6b3a08b2 · outbound

This paper cites Learning Video Representations using Contrastive Bidirectional Transformer.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Learning Video Representations using Contrastive Bidirectional Transformer

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.478560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.478560Z digest=sha256:8bc43b4c630db63549dfa3210fe0908d2bb05947a9c0b9f4b54bcd16c006a3a0

Observation 0f6d5388-38ec-4119-a6ee-04a42b624e94 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.481893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.481893Z digest=sha256:f9c72c7c06c4c15a23f7983748e8c3804e6ef4bad3aedb92974d6c9c09e1d3a2

Observation 0fa63ce4-1d95-4a3b-9e06-517f3a94d643 · outbound

This paper cites Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.488639Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.488639Z digest=sha256:de7838809cb5e644a67a73fd27b7930b42dd699f590f698ab7b7d2e99f324505

Observation d70a72fd-307e-41a1-a376-8e986d791e13 · outbound

This paper cites G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.491879Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.491879Z digest=sha256:11ba0d1966f775aafea7f5f29f9fe4374806babf0d6c4678b784a96904a77d67

Observation 689f95e0-4559-4c78-b7d5-3a11add0247e · outbound

This paper cites Lawrence Zitnick, and Devi Parikh.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Lawrence Zitnick, and Devi Parikh

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T20:16:34.948925Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.495285Z digest=sha256:511a790db2c3a34dc9a9a0d7c3c5886bbad6989dfb54302b5af7c750b27fb924

Observation 2b055535-333b-46f3-842e-8ed682e17685 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.937718Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.499179Z digest=sha256:41cfd533cfb43f0ddc8705cb622ff43d1e48fadafc2c272b1962d7150ab53158

Observation e54ea5e1-88ee-4922-9c2b-4b77e1e5fece · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 33

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.927429Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.502196Z digest=sha256:5c310977194244afd1263ef3420848d7b88e2d2a5cc15b7366e747b341afcb9b

Observation d072fc63-4471-401d-bf6e-e8000cacb45b · outbound

This paper cites LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.505752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.505752Z digest=sha256:4d8acc3308773776993ab2e13e50cf9a3ee117d3b029c5f8a245ac01371c6629

Observation 5b7356d2-bb7e-4cfa-a6dd-1917d7cbd8d4 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.915969Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.509235Z digest=sha256:36361936812d55204c57e7d0f3858acfe1e2936842a586567e02607b4314e27f

Observation 8f2f3108-e4f0-452b-b364-3f7e77b4f820 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.906687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.512146Z digest=sha256:7a8cc03da5570a685269a05568434ab0748bd729a2ba1f98bc2f4de944abd5f0

Observation e000a909-aa83-4292-8add-ad6365a077d3 · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.515394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.515394Z digest=sha256:4a1bea7be6d0f77865b6039594725a20fae8401e44311339fddf59b8d5df5246

Observation ce66fc99-86aa-49a4-b4f6-8ba6306c0928 · outbound

This paper cites mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.519439Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.519439Z digest=sha256:a35c7d1863564136466ad0740a62942cf607a9aa83235638d24407aebab1b486

Observation 021e247e-457f-43cd-9895-70703f97fa2f · outbound

This paper cites VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.522728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.522728Z digest=sha256:316d1208bd941cf9d4bb94702cb9b7e409c7a3781bffffb34c04ab4b7ea355e4

Observation b4ba473f-b6a0-47c2-ae54-75b5cb21f295 · outbound

This paper cites Weinberger, and Yoav Artzi.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Weinberger, and Yoav Artzi

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.526845Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.526845Z digest=sha256:4bcbf38764993344c85d9883cfa651d01efc0fd46dd01add8b7c4b2bc843755a

Observation d3bb8d43-6a44-48f6-97ce-44bf046ab13d · outbound

This paper cites The Three Amigos.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models The Three Amigos

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T20:16:34.885101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.534847Z digest=sha256:94f3014b38af2f6456618bd4a75d1b94411b0deb569b10abf5e3493a030ea4f9

Observation befd7d9a-3877-4b66-8cf0-7bd50b3d465f · outbound

This paper cites VideoBERT: A Joint Model for Video and Language Representation Learning.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models VideoBERT: A Joint Model for Video and Language Representation Learning

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.485103Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.485103Z digest=sha256:b388db9a12781053b72e62a38a26cf3196f08dfb096e7a9d15b9043615aa5bc4

Observation 8c6cc8b1-86bc-4485-b3ff-4f98c9eb1f1a · outbound

This paper cites InInternational Con- ference on Learning Representations.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models InInternational Con- ference on Learning Representations

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.530050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.530050Z digest=sha256:5cd679584df0e65f1a587be0f8cdd27f67c51e9d3d69c8d0e636871a01f087c7

Observation 2377a7b3-aeab-4418-b237-7c6ff0290edb · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 2022

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.048356Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T20:16:34.417144Z digest=sha256:bb32a105a30347c2cf325ddb99522ee3a60e4d94478a925645bd3eee3cdd3690

Pith citing papers

No inbound Pith citation observations are available.