{"as_of":"2026-08-09T11:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af90c7d26b33a8e6727220ab06065fe26df07f682680b0b9983ad87d98cc9b2b","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:16:34.534847Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04302/citation-record","integrity":"/paper/2608.04302/integrity","json":"/paper/2608.04302/citation-record.json","paper":"/paper/2608.04302"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.384643Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.384643Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:784cde4c368459f4aa0239ece19577a1f38441bf89ce2735d0ff8c68a50051ae","observation_id":"90e525e9-c911-4328-8b70-a47174a6dd66","resolution":{"observed_at":"2026-08-08T20:16:34.384643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.388393Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.388393Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:5c5d866e15fbd8fac641a76427813048315b1904e792863451e083f3e859039e","observation_id":"4e682979-f303-4655-b98c-24f72a54a037","resolution":{"observed_at":"2026-08-08T20:16:34.388393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:35.100973Z","title":"Chen and William B","venue":null,"work_id":"9f58af29-0a3c-4ddc-96bf-dbb4761ebdb9","year":2011},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.391706Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:f5d73083cc7e665b2dd938d62917d0ba4106a984303853595d9202ddad54242b","observation_id":"0f2bfdb1-5068-4b29-be5b-870da079cc2d","resolution":{"observed_at":"2026-08-08T20:16:35.104578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:35.091970Z","title":null,"venue":null,"work_id":"ba9492c4-85fa-4728-b03d-92ed882b4922","year":2024},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.395440Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:eb8e994408f2b6aaf5b774e9095706341f6e9b52a0ab7f702233493db42e923b","observation_id":"a7d1e4bd-17d0-4489-930c-6456b1bfe081","resolution":{"observed_at":"2026-08-08T20:16:35.095184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:35.082237Z","title":null,"venue":null,"work_id":"30ef598b-4a36-428f-ac19-a56eeb73ed67","year":2024},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.399584Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:4898d8ea6cdd2e0a64ed2119b0572f77a1b488feb2eb11a98c9108d0a60356ab","observation_id":"2970c550-7d5a-40d3-af60-fceb9b8a81b4","resolution":{"observed_at":"2026-08-08T20:16:35.086217Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:35.073364Z","title":null,"venue":null,"work_id":"362a597d-e772-4952-92b9-a70a69bff2ea","year":2021},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.402917Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:8588c2a0ab1a2cbbdc28b38c70d7b6ff4b2a7e6e8c0a87179cbc83ce4c0b2450","observation_id":"1582c9de-4f47-4d4a-8780-68c4ea6c95a6","resolution":{"observed_at":"2026-08-08T20:16:35.076467Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-08T20:16:34.407013Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.407013Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:1dbaa08dcf586847d36cfb6ef61845eb298ce9726ba2446734657b8272fe46cb","observation_id":"a3f21455-f719-443b-b591-f809e8fcb211","resolution":{"observed_at":"2026-08-08T20:16:34.407013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:35.063823Z","title":null,"venue":null,"work_id":"0c304b50-429c-492f-a5a1-7182dc1c0141","year":2020},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.410609Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:6cb02aee2ce56bcd95cb4b9b68c11ecc2a7aed442629c1afa726792f20e12624","observation_id":"753642d1-50af-464c-bab4-1dbbf9911e8d","resolution":{"observed_at":"2026-08-08T20:16:35.067015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:35.054389Z","title":null,"venue":null,"work_id":"c15ca975-4e50-48e4-af42-5c8b82ca821a","year":null},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.413771Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:9f7c3fe542e4d077530454797d37ddfd9e6b54be72db5c97b3fe2a71471e8366","observation_id":"4e8b7751-3cab-4e9c-99a7-fcdc69b33bf6","resolution":{"observed_at":"2026-08-08T20:16:35.057546Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01028","last_updated":"2025-01-15T03:02:22Z","snapshot_observed_at":"2026-08-09T10:02:11.480013Z","submitted_at":"2025-01-02T03:17:51Z","title":"KaLM-Embedding: Superior Training Data Brings A Stronger Embedding Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01028","snapshot_observed_at":"2026-08-08T20:16:34.420783Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.420783Z"},"links":{"cited_paper":"/paper/2501.01028","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:e04588ac0c483f9ff25f92d654b277a3f6cfde7435b03d61ce5752289e826302","observation_id":"8a56f043-1a1d-424c-b117-8fd3bc998e03","resolution":{"observed_at":"2026-08-08T20:16:34.420783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:35.034621Z","title":null,"venue":null,"work_id":"028d2b63-71ad-4eeb-a1ab-f6b65d42224a","year":2017},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.424459Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:6b7d5c3ef2305651c56d1ec716dd353eee9db0363831be919db6d119bb0ee486","observation_id":"62aedf90-4082-49ee-a8cf-ed397a9707f1","resolution":{"observed_at":"2026-08-08T20:16:35.038685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:35.025029Z","title":null,"venue":null,"work_id":"73617ff4-d65c-4b1e-831d-0fc3b88f7c90","year":2017},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.428250Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:8fb07c5044c05deb0415ec3d4c914c3a7981647b9a374f1d5ba4a97889c97366","observation_id":"019bf947-3c2d-4f9a-a848-4d6e6bd4dfc0","resolution":{"observed_at":"2026-08-08T20:16:35.028386Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-08T20:16:34.431149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.431149Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:1e0bc095f277d77b33407fc1939be2a58eea76705e5c7fcea948fd2b88943dee","observation_id":"d71e7e95-8a7d-4cc2-b0a1-5d27b15878c0","resolution":{"observed_at":"2026-08-08T20:16:34.431149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:35.014902Z","title":null,"venue":null,"work_id":"f159ea98-9bec-4143-8c67-71d36039c620","year":2018},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.434606Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:9d94c1fa92061017c7184f61836b43b5b1fa0624f95d4df0fe094a7876b2b60e","observation_id":"3831fa8c-bf59-40f4-8171-172052cb4d29","resolution":{"observed_at":"2026-08-08T20:16:35.018077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-08T20:16:34.437738Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.437738Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:c2129a1f2ddaba69cf561efb9f6c60a412a2b28fb70834e9d71ba2ea0eadf57d","observation_id":"7bad7fbf-c2d1-4e61-9f9f-4fdd4728a3ee","resolution":{"observed_at":"2026-08-08T20:16:34.437738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-08T20:16:34.442248Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.442248Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:689cc91b59884f1157d2c936f304701f280ec908fac84377414130f91cd37d12","observation_id":"a617dda4-f763-4c75-84bd-f36af7609cbb","resolution":{"observed_at":"2026-08-08T20:16:34.442248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03281","last_updated":"2023-08-07T03:52:59Z","snapshot_observed_at":"2026-08-04T23:10:23.964516Z","submitted_at":"2023-08-07T03:52:59Z","title":"Towards General Text Embeddings with Multi-stage Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03281","snapshot_observed_at":"2026-08-08T20:16:34.445759Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.445759Z"},"links":{"cited_paper":"/paper/2308.03281","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:8b13d1463500af5cc1053d70ef5ab7b77cc6fe2b2794a5d68b6fd42b5d03f8ee","observation_id":"c2dd8dab-8c8d-41b1-a819-aae22ea875c6","resolution":{"observed_at":"2026-08-08T20:16:34.445759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.449441Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.449441Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:b21209d12d05fa7ca82a79d18964bc0c1a72dc8c4e644e3aac9adf96dec9938f","observation_id":"889c4ed5-d568-4b95-9361-65fcc4896386","resolution":{"observed_at":"2026-08-08T20:16:34.449441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-08T20:16:34.452692Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.452692Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:8ef313a00a5000ac127cca8506c878fc43bb83231a9881396c49d075d7a7fa20","observation_id":"b467bf61-ccd9-4622-bc0d-5a605a726cc7","resolution":{"observed_at":"2026-08-08T20:16:34.452692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07316","last_updated":"2023-03-19T13:37:01Z","snapshot_observed_at":"2026-07-06T14:04:58.943383Z","submitted_at":"2022-10-13T19:42:08Z","title":"MTEB: Massive Text Embedding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07316","snapshot_observed_at":"2026-08-08T20:16:34.456111Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.456111Z"},"links":{"cited_paper":"/paper/2210.07316","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:9e55219839cce0d23952af42be3d0176cf5b14c83e5432d1bf1f823199bce17b","observation_id":"c1a17fd2-de85-469d-80e4-623e86192b12","resolution":{"observed_at":"2026-08-08T20:16:34.456111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.999416Z","title":null,"venue":null,"work_id":"deacafe5-c0ff-4fe8-a647-266d49914ac4","year":2002},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.459488Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:f5035293ff54d29330eaf732fc926ce667b04ed244eecd51b33b58733c7e8757","observation_id":"507ddfc6-018c-4dad-a926-47cd89f360e5","resolution":{"observed_at":"2026-08-08T20:16:35.002669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.988643Z","title":null,"venue":null,"work_id":"bd98b3a5-ddb0-4a8e-8dc5-71d1ef0b1fbe","year":2019},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.462356Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:73a2cb713a55dadc79012427bd33ad394520ef594fe83e592e02f472fb487d5c","observation_id":"8e850048-92e3-4996-93b0-6887b42a6d0d","resolution":{"observed_at":"2026-08-08T20:16:34.992472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.979537Z","title":null,"venue":null,"work_id":"0b49e83c-1c56-4413-8722-048917c1bb93","year":2019},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.465238Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:d1034f3a644e34f8546a9b474be5d69bb297353e0bc97d8bd4f99fb9328d4348","observation_id":"b69efeb4-e38f-409a-9cd4-4175dc29d9cc","resolution":{"observed_at":"2026-08-08T20:16:34.982682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.970229Z","title":null,"venue":null,"work_id":"926ea4b2-2570-4b5b-8048-146920432b96","year":2014},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.468308Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:0ea316a369abd84c3bff96d5593dfd6cf4943167624fffc8f5e94b23acaaa8a8","observation_id":"a96b9b52-63ca-4bae-a291-4e8dc2f7bad5","resolution":{"observed_at":"2026-08-08T20:16:34.973646Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-08T20:16:34.471457Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.471457Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:ee7d2a3263857ebe8c5f73a131020e679f309d13e6263d218b3595cc91ab4b45","observation_id":"8c17c894-8ce3-49cd-8f47-08d5f941c46d","resolution":{"observed_at":"2026-08-08T20:16:34.471457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.961025Z","title":null,"venue":null,"work_id":"b2dd58b5-c573-4910-a827-a26b4d713285","year":2022},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.474698Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:95c60770031ee5ff203dbaba171b39114b1b59c32aa13bb7fba23b935eb20de4","observation_id":"771885ca-b742-45d0-a498-9af0ca2f7ee1","resolution":{"observed_at":"2026-08-08T20:16:34.964283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05743","last_updated":"2019-09-27T21:59:59Z","snapshot_observed_at":"2026-08-07T11:03:21.673722Z","submitted_at":"2019-06-13T15:03:52Z","title":"Learning Video Representations using Contrastive Bidirectional Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05743","snapshot_observed_at":"2026-08-08T20:16:34.478560Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.478560Z"},"links":{"cited_paper":"/paper/1906.05743","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:8bc43b4c630db63549dfa3210fe0908d2bb05947a9c0b9f4b54bcd16c006a3a0","observation_id":"73fa8f2e-070a-432e-8175-c93a6b3a08b2","resolution":{"observed_at":"2026-08-08T20:16:34.478560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.481893Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.481893Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:f9c72c7c06c4c15a23f7983748e8c3804e6ef4bad3aedb92974d6c9c09e1d3a2","observation_id":"0f6d5388-38ec-4119-a6ee-04a42b624e94","resolution":{"observed_at":"2026-08-08T20:16:34.481893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-08-08T20:16:34.488639Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.488639Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:de7838809cb5e644a67a73fd27b7930b42dd699f590f698ab7b7d2e99f324505","observation_id":"0fa63ce4-1d95-4a3b-9e06-517f3a94d643","resolution":{"observed_at":"2026-08-08T20:16:34.488639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13647","last_updated":"2024-12-19T15:37:55Z","snapshot_observed_at":"2026-08-05T12:04:38.510941Z","submitted_at":"2024-12-18T09:23:12Z","title":"G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13647","snapshot_observed_at":"2026-08-08T20:16:34.491879Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.491879Z"},"links":{"cited_paper":"/paper/2412.13647","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:11ba0d1966f775aafea7f5f29f9fe4374806babf0d6c4678b784a96904a77d67","observation_id":"d70a72fd-307e-41a1-a376-8e986d791e13","resolution":{"observed_at":"2026-08-08T20:16:34.491879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.943861Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"f7081a0f-72ce-4c91-800c-1862a8a7fde9","year":2015},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.495285Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:511a790db2c3a34dc9a9a0d7c3c5886bbad6989dfb54302b5af7c750b27fb924","observation_id":"689f95e0-4559-4c78-b7d5-3a11add0247e","resolution":{"observed_at":"2026-08-08T20:16:34.948925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.933856Z","title":null,"venue":null,"work_id":"58cc98bb-986e-4589-a849-a817ff955a37","year":2018},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.499179Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:41cfd533cfb43f0ddc8705cb622ff43d1e48fadafc2c272b1962d7150ab53158","observation_id":"2b055535-333b-46f3-842e-8ed682e17685","resolution":{"observed_at":"2026-08-08T20:16:34.937718Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.923303Z","title":null,"venue":null,"work_id":"5ed003ba-c0e7-4027-9701-a1bbf122aff4","year":2019},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.502196Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:5c310977194244afd1263ef3420848d7b88e2d2a5cc15b7366e747b341afcb9b","observation_id":"e54ea5e1-88ee-4922-9c2b-4b77e1e5fece","resolution":{"observed_at":"2026-08-08T20:16:34.927429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-08T20:16:34.505752Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.505752Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:4d8acc3308773776993ab2e13e50cf9a3ee117d3b029c5f8a245ac01371c6629","observation_id":"d072fc63-4471-401d-bf6e-e8000cacb45b","resolution":{"observed_at":"2026-08-08T20:16:34.505752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.912657Z","title":null,"venue":null,"work_id":"03c3cadc-bbdc-4df2-8392-ea44b2fb4003","year":2021},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.509235Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:36361936812d55204c57e7d0f3858acfe1e2936842a586567e02607b4314e27f","observation_id":"5b7356d2-bb7e-4cfa-a6dd-1917d7cbd8d4","resolution":{"observed_at":"2026-08-08T20:16:34.915969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.902576Z","title":null,"venue":null,"work_id":"72704c47-49e8-4580-9258-572891bad316","year":2016},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.512146Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:7a8cc03da5570a685269a05568434ab0748bd729a2ba1f98bc2f4de944abd5f0","observation_id":"8f2f3108-e4f0-452b-b364-3f7e77b4f820","resolution":{"observed_at":"2026-08-08T20:16:34.906687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-08T20:16:34.515394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.515394Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:4a1bea7be6d0f77865b6039594725a20fae8401e44311339fddf59b8d5df5246","observation_id":"e000a909-aa83-4292-8add-ad6365a077d3","resolution":{"observed_at":"2026-08-08T20:16:34.515394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-08T20:16:34.519439Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.519439Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:a35c7d1863564136466ad0740a62942cf607a9aa83235638d24407aebab1b486","observation_id":"ce66fc99-86aa-49a4-b4f6-8ba6306c0928","resolution":{"observed_at":"2026-08-08T20:16:34.519439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-08T20:16:34.522728Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.522728Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:316d1208bd941cf9d4bb94702cb9b7e409c7a3781bffffb34c04ab4b7ea355e4","observation_id":"021e247e-457f-43cd-9895-70703f97fa2f","resolution":{"observed_at":"2026-08-08T20:16:34.522728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.526845Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.526845Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:4bcbf38764993344c85d9883cfa651d01efc0fd46dd01add8b7c4b2bc843755a","observation_id":"b4ba473f-b6a0-47c2-ae54-75b5cb21f295","resolution":{"observed_at":"2026-08-08T20:16:34.526845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.880469Z","title":"The Three Amigos","venue":null,"work_id":"ac774367-8cee-42da-b4e4-10b4a47b6ed1","year":2018},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.534847Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:94f3014b38af2f6456618bd4a75d1b94411b0deb569b10abf5e3493a030ea4f9","observation_id":"d3bb8d43-6a44-48f6-97ce-44bf046ab13d","resolution":{"observed_at":"2026-08-08T20:16:34.885101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01766","last_updated":"2019-09-11T19:52:54Z","snapshot_observed_at":"2026-07-06T07:43:30.348919Z","submitted_at":"2019-04-03T04:40:16Z","title":"VideoBERT: A Joint Model for Video and Language Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01766","snapshot_observed_at":"2026-08-08T20:16:34.485103Z","title":"arXiv preprint arXiv:1904.01766","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.485103Z"},"links":{"cited_paper":"/paper/1904.01766","citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:b388db9a12781053b72e62a38a26cf3196f08dfb096e7a9d15b9043615aa5bc4","observation_id":"befd7d9a-3877-4b66-8cf0-7bd50b3d465f","resolution":{"observed_at":"2026-08-08T20:16:34.485103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:34.530050Z","title":"InInternational Con- ference on Learning Representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.530050Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:5cd679584df0e65f1a587be0f8cdd27f67c51e9d3d69c8d0e636871a01f087c7","observation_id":"8c6cc8b1-86bc-4485-b3ff-4f98c9eb1f1a","resolution":{"observed_at":"2026-08-08T20:16:34.530050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:16:35.044835Z","title":null,"venue":null,"work_id":"1dd1d70f-9217-4d5e-98ae-16554dd31dcf","year":null},"citing_paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T20:16:34.417144Z"},"links":{"citing_paper":"/paper/2608.04302"},"observation_digest":"sha256:bb32a105a30347c2cf325ddb99522ee3a60e4d94478a925645bd3eee3cdd3690","observation_id":"2377a7b3-aeab-4418-b237-7c6ff0290edb","resolution":{"observed_at":"2026-08-08T20:16:35.048356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.04302","last_updated":"2026-08-05T00:20:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:10:00.977754Z","submitted_at":"2026-08-05T00:20:23Z","title":"CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.04302."}