Pith. sign in

Paper Citation Record · LEDGER

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.04302.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.04302 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T20:16:34.534847Z

measured 44 of 44 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

44 of 44 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved41
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 90e525e9-c911-4328-8b70-a47174a6dd66 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.384643Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.384643Z digest=sha256:784cde4c368459f4aa0239ece19577a1f38441bf89ce2735d0ff8c68a50051ae

Observation 4e682979-f303-4655-b98c-24f72a54a037 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.388393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.388393Z digest=sha256:5c5d866e15fbd8fac641a76427813048315b1904e792863451e083f3e859039e

Observation 0f2bfdb1-5068-4b29-be5b-870da079cc2d · outbound

This paper cites Chen and William B.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Chen and William B

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T20:16:35.104578Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.391706Z digest=sha256:9d6b1b77685195bf2354235f24a6c6a63111b9e942989a922aac3234b1ae54c4

Observation a7d1e4bd-17d0-4489-930c-6456b1bfe081 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.095184Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.395440Z digest=sha256:960c047e0478da1b77bca20bb03c50c2f5f269b44aa87fcfe3bbaf7f8df96017

Observation 2970c550-7d5a-40d3-af60-fceb9b8a81b4 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.086217Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.399584Z digest=sha256:1d172fba2fe95a1d6a0231fdc687552b3772554b9a8eceaa893ffeceeed549a2

Observation 1582c9de-4f47-4d4a-8780-68c4ea6c95a6 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.076467Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.402917Z digest=sha256:98b43a10253ceaa92a60a97ed52e44bdfc0766632ee2b0c875aa3c3b42143373

Observation a3f21455-f719-443b-b591-f809e8fcb211 · outbound

This paper cites Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.407013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.407013Z digest=sha256:1dbaa08dcf586847d36cfb6ef61845eb298ce9726ba2446734657b8272fe46cb

Observation 753642d1-50af-464c-bab4-1dbbf9911e8d · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.067015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.410609Z digest=sha256:94216d8f850979d63fad3294d4d601eef31cf16b49ccf8b0f91f141f92b6e622

Observation 4e8b7751-3cab-4e9c-99a7-fcdc69b33bf6 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.057546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.413771Z digest=sha256:76141fcd4d8489a24ab151e53c033d9625116dd0db8eed2b9db394130f86e906

Observation 8a56f043-1a1d-424c-b117-8fd3bc998e03 · outbound

This paper cites KaLM-Embedding: Superior Training Data Brings A Stronger Embedding Model.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models KaLM-Embedding: Superior Training Data Brings A Stronger Embedding Model

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.420783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.420783Z digest=sha256:acc9f0ccde33179ce4fb5296ff025f8737901170c80705308050e0c0471c10d3

Observation 62aedf90-4082-49ee-a8cf-ed397a9707f1 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.038685Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.424459Z digest=sha256:475a02c693b60540bfeb051c6b61b13485b0ef83b886d693528221f884f0bdff

Observation 019bf947-3c2d-4f9a-a848-4d6e6bd4dfc0 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.028386Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.428250Z digest=sha256:e0769548e9492850c688534fda8ba60dfc096a96a75f53c44bdaa5a6b61280d5

Observation d71e7e95-8a7d-4cc2-b0a1-5d27b15878c0 · outbound

This paper cites NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.431149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.431149Z digest=sha256:1e0bc095f277d77b33407fc1939be2a58eea76705e5c7fcea948fd2b88943dee

Observation 3831fa8c-bf59-40f4-8171-172052cb4d29 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.018077Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.434606Z digest=sha256:8a6052643df52a17f892d43a83b69873120557443da358b0b83f657aa3927a21

Observation 7bad7fbf-c2d1-4e61-9f9f-4fdd4728a3ee · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models VideoChat: Chat-Centric Video Understanding

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.437738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.437738Z digest=sha256:c2129a1f2ddaba69cf561efb9f6c60a412a2b28fb70834e9d71ba2ea0eadf57d

Observation a617dda4-f763-4c75-84bd-f36af7609cbb · outbound

This paper cites MVBench: A Comprehensive Multi-modal Video Understanding Benchmark.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models MVBench: A Comprehensive Multi-modal Video Understanding Benchmark

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.442248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.442248Z digest=sha256:689cc91b59884f1157d2c936f304701f280ec908fac84377414130f91cd37d12

Observation c2dd8dab-8c8d-41b1-a819-aae22ea875c6 · outbound

This paper cites Towards General Text Embeddings with Multi-stage Contrastive Learning.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Towards General Text Embeddings with Multi-stage Contrastive Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.445759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.445759Z digest=sha256:8b13d1463500af5cc1053d70ef5ab7b77cc6fe2b2794a5d68b6fd42b5d03f8ee

Observation 889c4ed5-d568-4b95-9361-65fcc4896386 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.449441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.449441Z digest=sha256:b21209d12d05fa7ca82a79d18964bc0c1a72dc8c4e644e3aac9adf96dec9938f

Observation b467bf61-ccd9-4622-bc0d-5a605a726cc7 · outbound

This paper cites G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.452692Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.452692Z digest=sha256:8ef313a00a5000ac127cca8506c878fc43bb83231a9881396c49d075d7a7fa20

Observation c1a17fd2-de85-469d-80e4-623e86192b12 · outbound

This paper cites MTEB: Massive Text Embedding Benchmark.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models MTEB: Massive Text Embedding Benchmark

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.456111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.456111Z digest=sha256:9e55219839cce0d23952af42be3d0176cf5b14c83e5432d1bf1f823199bce17b

Observation 507ddfc6-018c-4dad-a926-47cd89f360e5 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.002669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.459488Z digest=sha256:ec160ce3e47b8d481dd2f7c0082e29649716380c0ac8a42da8e65271b1ed1a2b

Observation 8e850048-92e3-4996-93b0-6887b42a6d0d · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.992472Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.462356Z digest=sha256:c8fe87f591333560d41c13597099e114234b4dc1c20a851bd4b7a1dfe18b8258

Observation b69efeb4-e38f-409a-9cd4-4175dc29d9cc · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.982682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.465238Z digest=sha256:f756a0305668e16b4cd614cee87b7c34ee6e5a19724bacbdbfb1e29a3ba4d8ec

Observation a96b9b52-63ca-4bae-a291-4e8dc2f7bad5 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.973646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.468308Z digest=sha256:091d08f8beeb832d41a79dbe532ddb0b4ca452e8783626ff902148f0132101c5

Observation 8c17c894-8ce3-49cd-8f47-08d5f941c46d · outbound

This paper cites LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.471457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.471457Z digest=sha256:ee7d2a3263857ebe8c5f73a131020e679f309d13e6263d218b3595cc91ab4b45

Observation 771885ca-b742-45d0-a498-9af0ca2f7ee1 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.964283Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.474698Z digest=sha256:938c167c57251d4ac3c30c95a7bc7d0bb2f8ad5e28815cca312d5c3ac1b706e8

Observation 73fa8f2e-070a-432e-8175-c93a6b3a08b2 · outbound

This paper cites Learning Video Representations using Contrastive Bidirectional Transformer.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Learning Video Representations using Contrastive Bidirectional Transformer

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.478560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.478560Z digest=sha256:8bc43b4c630db63549dfa3210fe0908d2bb05947a9c0b9f4b54bcd16c006a3a0

Observation 0f6d5388-38ec-4119-a6ee-04a42b624e94 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.481893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.481893Z digest=sha256:f9c72c7c06c4c15a23f7983748e8c3804e6ef4bad3aedb92974d6c9c09e1d3a2

Observation 0fa63ce4-1d95-4a3b-9e06-517f3a94d643 · outbound

This paper cites Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.488639Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.488639Z digest=sha256:de7838809cb5e644a67a73fd27b7930b42dd699f590f698ab7b7d2e99f324505

Observation d70a72fd-307e-41a1-a376-8e986d791e13 · outbound

This paper cites G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.491879Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.491879Z digest=sha256:11ba0d1966f775aafea7f5f29f9fe4374806babf0d6c4678b784a96904a77d67

Observation 689f95e0-4559-4c78-b7d5-3a11add0247e · outbound

This paper cites Lawrence Zitnick, and Devi Parikh.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Lawrence Zitnick, and Devi Parikh

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T20:16:34.948925Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.495285Z digest=sha256:c77302285f691a0a79affcd435977fd7ac6d8ee355a1629b4e72aa511d3b88c4

Observation 2b055535-333b-46f3-842e-8ed682e17685 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.937718Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.499179Z digest=sha256:84bd52ec506df78cf3eb3ae669b71a19d517b040abd193d707a6ad5bc060eca2

Observation e54ea5e1-88ee-4922-9c2b-4b77e1e5fece · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 33

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.927429Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.502196Z digest=sha256:c6326b55e9f208e2d0aa1ba20231da0b53d2ab3d297d59513c14312f9edfd0b9

Observation d072fc63-4471-401d-bf6e-e8000cacb45b · outbound

This paper cites LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.505752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.505752Z digest=sha256:4d8acc3308773776993ab2e13e50cf9a3ee117d3b029c5f8a245ac01371c6629

Observation 5b7356d2-bb7e-4cfa-a6dd-1917d7cbd8d4 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.915969Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.509235Z digest=sha256:328ad50d0d6e5054e28bb841bb77d512f9b140c806580d5ce887fac61d86a810

Observation 8f2f3108-e4f0-452b-b364-3f7e77b4f820 · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:34.906687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.512146Z digest=sha256:e7914c60e807f34ab1618c947f13e7f1525b8ba43afde930097b27553e11bde9

Observation e000a909-aa83-4292-8add-ad6365a077d3 · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.515394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.515394Z digest=sha256:4a1bea7be6d0f77865b6039594725a20fae8401e44311339fddf59b8d5df5246

Observation ce66fc99-86aa-49a4-b4f6-8ba6306c0928 · outbound

This paper cites mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.519439Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.519439Z digest=sha256:a35c7d1863564136466ad0740a62942cf607a9aa83235638d24407aebab1b486

Observation 021e247e-457f-43cd-9895-70703f97fa2f · outbound

This paper cites VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.522728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.522728Z digest=sha256:316d1208bd941cf9d4bb94702cb9b7e409c7a3781bffffb34c04ab4b7ea355e4

Observation b4ba473f-b6a0-47c2-ae54-75b5cb21f295 · outbound

This paper cites Weinberger, and Yoav Artzi.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Weinberger, and Yoav Artzi

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.526845Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.526845Z digest=sha256:4bcbf38764993344c85d9883cfa651d01efc0fd46dd01add8b7c4b2bc843755a

Observation d3bb8d43-6a44-48f6-97ce-44bf046ab13d · outbound

This paper cites The Three Amigos.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models The Three Amigos

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T20:16:34.885101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.534847Z digest=sha256:6d2bb528c61a305ea4d217ba491507a8c30847191dc042d399685cffa73a9213

Observation befd7d9a-3877-4b66-8cf0-7bd50b3d465f · outbound

This paper cites VideoBERT: A Joint Model for Video and Language Representation Learning.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models VideoBERT: A Joint Model for Video and Language Representation Learning

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.485103Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.485103Z digest=sha256:b388db9a12781053b72e62a38a26cf3196f08dfb096e7a9d15b9043615aa5bc4

Observation 8c6cc8b1-86bc-4485-b3ff-4f98c9eb1f1a · outbound

This paper cites InInternational Con- ference on Learning Representations.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models InInternational Con- ference on Learning Representations

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-08T20:16:34.530050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T20:16:34.530050Z digest=sha256:5cd679584df0e65f1a587be0f8cdd27f67c51e9d3d69c8d0e636871a01f087c7

Observation 2377a7b3-aeab-4418-b237-7c6ff0290edb · outbound

This paper cites an unresolved cited work.

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Unresolved cited work

Reference 2022

Resolution
unresolved
raw_fallback, observed 2026-08-08T20:16:35.048356Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-08T20:16:34.417144Z digest=sha256:65bbb582d4c6c2f2e5a14e7a9497ca77a13a6826a42a7a0260f43dd6a9e9e642

Pith citing papers

No inbound Pith citation observations are available.