{"as_of":"2026-08-12T08:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53e797ff1caff985d6d55190e5f4410f51547d18a5449b17a5dcaa8a6a4446a1","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:40:22.275159Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.07704/citation-record","integrity":"/paper/2412.07704/integrity","json":"/paper/2412.07704/citation-record.json","paper":"/paper/2412.07704"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-11T18:40:21.730017Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.730017Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:5f3857c0cd5bad5190d55fb90b26e3e44ef7959bf7224295627be029bf053a20","observation_id":"675d14c4-d3a2-45a6-a40d-716825cb5614","resolution":{"observed_at":"2026-08-11T18:40:21.730017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:21.736471Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.736471Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:8d0bcfc4ce2d12b83ecab9c07e21bbf9362e6c329f947a3c3b28d7ff74a99226","observation_id":"b47675f9-c508-4379-bb3e-d4d290741054","resolution":{"observed_at":"2026-08-11T18:40:21.736471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:24.236577Z","title":"Hiervl: Learning hierarchical video- language embeddings","venue":null,"work_id":"e5c97d22-56c9-46c2-957a-7a52a76d3aaf","year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.744196Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:5c5a53d15dbb308198936a5906f5cce27db26d1f7be6ddd0ccb0e8105b0ead49","observation_id":"38d5c2e2-3795-476a-b98c-d71670add427","resolution":{"observed_at":"2026-08-11T18:40:24.241716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:21.751687Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.751687Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:a8e1fae1dc14949eb8e7ae9cf4b998afb329f92101b309b98821a25889b5613a","observation_id":"b74dc9e9-fa4a-41c3-9209-ef3c5f19b86d","resolution":{"observed_at":"2026-08-11T18:40:21.751687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:24.209653Z","title":"Is space-time attention all you need for video understanding? In ICML, volume 2, page 4, 2021","venue":null,"work_id":"bd81840a-35bc-48e1-9782-30d79823d0c5","year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.759600Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:99b1344c5b875dd6e39ee5aeeeebac33267dd845079b245e747501e449741850","observation_id":"f5fc93dc-7da2-4886-927a-590bf0e0459a","resolution":{"observed_at":"2026-08-11T18:40:24.215387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:24.187813Z","title":"Blinkdl/rwkv-lm","venue":null,"work_id":"8ea81c8f-1a10-46e7-ad58-8a9ff66cc05a","year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.767273Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:d19363c5b556421d6a65dbb33674ff47038acc32704d9a9161dd0d2e0c768f01","observation_id":"34c8f8ad-7228-4930-8442-ff00864656f5","resolution":{"observed_at":"2026-08-11T18:40:24.192917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:24.159451Z","title":"Revisiting the” video” in video-language understanding","venue":null,"work_id":"54449cad-64ec-4b77-b9ba-adcda9452931","year":2022},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.778008Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:d5192281a15767b1ce5bcb4e1420f4fc614366d0566406b3e0bdda25cd0dc686","observation_id":"172b787c-158d-4dea-9fd9-a028f716f0fc","resolution":{"observed_at":"2026-08-11T18:40:24.166350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:21.787702Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.787702Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:f3c19731e372ce27c476b672b17f1b820c11b9a082ed902a75ec11637c3ce16f","observation_id":"4bcf2b93-2c01-4852-ae96-741a45dfa03e","resolution":{"observed_at":"2026-08-11T18:40:21.787702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:24.120785Z","title":"Locvtp: Video-text pre-training for temporal localization","venue":null,"work_id":"dcabc70b-ad2d-4309-bdb4-323b1783ae7f","year":2022},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.795890Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:d7637f164856909736809d48f9888c6ad836619f7bd746828574313b723f595a","observation_id":"f0f99526-3ada-45a8-923f-01379c9e66b3","resolution":{"observed_at":"2026-08-11T18:40:24.132133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:24.101108Z","title":"Metaxas, and Hongxia Yang","venue":null,"work_id":"062371ef-2072-4e08-99de-74a744098ba3","year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.804376Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:d0d486eb396a4f69207de7716af421a9f912e53b997bb498c4421fc2aeb31fb3","observation_id":"51d10e7b-49f6-44d8-ac88-ea40bf174a17","resolution":{"observed_at":"2026-08-11T18:40:24.106905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:24.080483Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"3b4fc37f-80af-443d-90ea-1d83d4fe4448","year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.809265Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:2afe2c3e081f2ab9fc47cab99a692214343d03f9294e34f9f03afe2070d98502","observation_id":"936c7b90-1738-482d-b743-2c656a516604","resolution":{"observed_at":"2026-08-11T18:40:24.086270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:24.053407Z","title":"Unsupervised and semi-supervised domain adaptation for action recognition from drones","venue":null,"work_id":"0137eb0c-2f29-4ab0-ab11-74d2a26a038f","year":2020},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.815871Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:b881c49ca59c6c06486550dcc7238062cd1867fa2526dfdeb4ae055e41e64278","observation_id":"83564cf4-7ebe-42db-ba93-4a78643a4965","resolution":{"observed_at":"2026-08-11T18:40:24.059920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:24.033480Z","title":"Free dolly: Introducing the world’s first truly open instruction-tuned llm","venue":null,"work_id":"5a236e05-e7ab-4c2e-93d9-915a965b3c51","year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.822659Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:97fe424e0024bdf9620880b5705bad32d949e8a629f32021b7663b34ea30002e","observation_id":"e0c386f9-b55b-4cae-92fc-1303633d524b","resolution":{"observed_at":"2026-08-11T18:40:24.039299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:24.002841Z","title":"Prompt switch: Efficient clip adaptation for text-video re- trieval","venue":null,"work_id":"345746bb-d4fa-443a-8b4f-9a700d1641fa","year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.831924Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:28f2f5e015a42cc5b4cd59fbd3c17bdf0be2929b2063f275e0dc273c94fcebc3","observation_id":"18e3b570-4d85-432f-bdcf-5c61fa1298c8","resolution":{"observed_at":"2026-08-11T18:40:24.011454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:21.837845Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.837845Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:0e6e8e1c1f12e1a8d02b45d92b11007bdfdeeef234e672134f36c7ba2a78186c","observation_id":"ea1e73ca-d9b1-40f0-abc4-c90b0ae38730","resolution":{"observed_at":"2026-08-11T18:40:21.837845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.962354Z","title":"Text-guided video masked autoencoder","venue":null,"work_id":"573de11c-b5ef-47e9-9725-2d434026b663","year":null},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.844329Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:5982defc95b6f85b90d098799866b02b2cafd1cfb755f1a5c1cb27cc7c473905","observation_id":"44711116-d431-413a-b5ab-30eafca01d55","resolution":{"observed_at":"2026-08-11T18:40:23.967912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:21.857535Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.857535Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:e69e44fc90d72e3bf8781775c3ca0e8f095efb836fc2eb75a898822bfcf8961d","observation_id":"87dcb7e5-5f7f-4c77-8885-fc4d1ed888e5","resolution":{"observed_at":"2026-08-11T18:40:21.857535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12681","last_updated":"2022-04-16T04:21:26Z","snapshot_observed_at":"2026-08-04T04:22:15.975890Z","submitted_at":"2021-11-24T18:31:20Z","title":"VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12681","snapshot_observed_at":"2026-08-11T18:40:21.865905Z","title":"Violet: End-to-end video-language transformers with masked visual-token mod- eling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.865905Z"},"links":{"cited_paper":"/paper/2111.12681","citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:2f5122b1825703567d5b49503f2052bdeed767d019c833bdbc607731af3d5a1c","observation_id":"a19e7fb1-7fe3-4e50-992a-7320ce51d2b9","resolution":{"observed_at":"2026-08-11T18:40:21.865905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.897087Z","title":"Multi-modal transformer for video retrieval","venue":null,"work_id":"9693397d-64f8-43bd-badb-72d5aceb0b03","year":2020},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.873145Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:cc2d821044088aca2dd34a5cca15df4425d0ee0de6670714f60ad3722d86fca7","observation_id":"18b4b722-8935-494a-9cf8-8deb5bf16990","resolution":{"observed_at":"2026-08-11T18:40:23.922208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.872480Z","title":"Openllama: An open repro- duction of llama","venue":null,"work_id":"446f22e5-5d61-4050-9908-7525b6e8d2b8","year":null},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.878555Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:1805438ad6a95571db3d1b142122b2ba4005189d0cfc299692d7a7b762ab66e8","observation_id":"080c0049-af7c-4442-88b9-29b1076e3965","resolution":{"observed_at":"2026-08-11T18:40:23.881286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:21.887912Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.887912Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:5df427b1c4530c05a04e275f491c7e2cd52e00db6a729db3201769122ba2b242","observation_id":"858f3263-772b-419f-bf27-ab7e57e7adc8","resolution":{"observed_at":"2026-08-11T18:40:21.887912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.831217Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"cf4ba04f-5375-4f45-88cb-98ea22009d12","year":2024},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.893595Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:7d0710607027f6beb13f1c9af8cfb4bc0403f5edd8c75eb8980f24ce2a39a72d","observation_id":"1dc6f2b7-473c-420b-83a7-58515e2278ce","resolution":{"observed_at":"2026-08-11T18:40:23.839314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.810466Z","title":"Long movie clip classification with state-space video models","venue":null,"work_id":"2000ee52-e178-4791-adf6-5d4f68174ac4","year":null},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.901974Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:f61f8dd4e98bb440e9bfda2d05861d61bb576b987538a4e2497c2f636d2f51bc","observation_id":"0ec6fe47-169b-45ab-a838-17919f451dad","resolution":{"observed_at":"2026-08-11T18:40:23.818116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.785417Z","title":"Video re- cap: Recursive captioning of hour-long videos","venue":null,"work_id":"9ec49b45-4be8-4800-825d-c952d160e467","year":2024},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.908126Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:8bfa696bde0a965fff40ed0510db013a64ae40549d4120265fa3681f6ab89d90","observation_id":"df4f55af-fa3a-40f4-8e0a-65cc1978df08","resolution":{"observed_at":"2026-08-11T18:40:23.792138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:21.914293Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.914293Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:a2f654fb066bd764d080f06d942609a8e48beab98324acd589837ec6f24b5c0a","observation_id":"363a9f56-e2ba-483b-ae32-7a3e6db037f0","resolution":{"observed_at":"2026-08-11T18:40:21.914293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.756863Z","title":"Le, Yun-Hsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":"e795f499-90a4-46fb-b832-452cefd06a18","year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.919118Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:1505be37b5bc3f73d5a79b304642efb7af22c1ff44e1989d410461f12a1ecf19","observation_id":"812c4982-dced-47e4-85a8-6fd4b60f6468","resolution":{"observed_at":"2026-08-11T18:40:23.761987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.738240Z","title":"Dense-captioning events in videos","venue":null,"work_id":"7d43ed84-70e0-4929-80cc-fa04f48b12fd","year":2017},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.929454Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:6a782ab3b0b51e3650784591fc993aafb5e075dd58c6f76100073db9144b4596","observation_id":"c8dccd7a-5203-4e85-a82d-112f67b55425","resolution":{"observed_at":"2026-08-11T18:40:23.743632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23782","last_updated":"2024-10-31T09:55:32Z","snapshot_observed_at":"2026-08-10T13:02:50.280033Z","submitted_at":"2024-10-31T09:55:32Z","title":"Video Token Merging for Long-form Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23782","snapshot_observed_at":"2026-08-11T18:40:21.935406Z","title":"Video token merging for long-form video under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.935406Z"},"links":{"cited_paper":"/paper/2410.23782","citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:083fc32481a07edc7327a4ca07235ad91ad867ada1a7ab2c838fe4783d006f21","observation_id":"986c2357-dba8-4c17-8413-b75dd961f300","resolution":{"observed_at":"2026-08-11T18:40:21.935406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.704845Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"08afc384-a1c1-4ec1-bf4d-55f2ae904b57","year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.940599Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:23120e63b0578af77150b5506f026ba5b1548848e1f871f71c45e892aee5753b","observation_id":"55c1a9b1-a921-4da6-a56e-5fc612464cf6","resolution":{"observed_at":"2026-08-11T18:40:23.710374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.684674Z","title":"Gonzalez, Ion Stoica, Xuezhe Ma, and Hao Zhang","venue":null,"work_id":"6a441f47-8db6-4d1c-83ba-4e8ab802ff02","year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.949222Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:a8e41807ba00f04a33c5c6d78be30a5516233e5063b8ea5705120ee6d4811612","observation_id":"3fdf41e7-e82d-41c5-a7b3-2187ec78968e","resolution":{"observed_at":"2026-08-11T18:40:23.692431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.668360Z","title":"Hero: Hierarchical encoder for video+ lan- guage omni-representation pre-training","venue":null,"work_id":"d171a35d-a155-4a5c-9b82-24db0f2f6066","year":2020},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.954005Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:2d1670ab060ceedbf3097801d0917cbaf1524757df29747eefe97f49bc70e9db","observation_id":"1a756374-a7bb-4303-8d5e-f8fd96dfb66f","resolution":{"observed_at":"2026-08-11T18:40:23.673939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.628687Z","title":"Lavender: Unifying video- language understanding as masked language modeling","venue":null,"work_id":"a5ff4457-2b29-4509-b939-2b066fae676b","year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.962406Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:5f8af59f3cd98d9bc669b2ace5904b8ccae192b01b968afb572c0048ac441db7","observation_id":"22634687-060e-427a-bff1-b6c0f8143e31","resolution":{"observed_at":"2026-08-11T18:40:23.648567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.602369Z","title":"Ego-exo: Transferring visual representations from third-person to first-person videos","venue":null,"work_id":"34adcd26-38ba-4a2f-87df-1b8fae91f5f0","year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.969173Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:5f02e8d6ec77973e7256a4d4892e70d05e52c8bdad8d408d7afee7ce3211297e","observation_id":"f49ba053-96f9-450c-9b42-0083c9bdfcd9","resolution":{"observed_at":"2026-08-11T18:40:23.615730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:21.975946Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.975946Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:c60673d3e07d31a2721751c9a8b346eda0732438d3667de6d4929ebc98329ea7","observation_id":"0de33a2d-d776-4a50-a48b-0f03f32bb807","resolution":{"observed_at":"2026-08-11T18:40:21.975946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.556517Z","title":"Egocentric video-language pretraining","venue":null,"work_id":"0febd5c7-bd69-4ce9-985e-c24472704f64","year":2022},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:21.984672Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:a96a19a739187c8396f2c56176997032dc78ef090d23dba220fb9d43bd46009f","observation_id":"e17bd6b1-8794-4626-8b68-7eb329baeab3","resolution":{"observed_at":"2026-08-11T18:40:23.564693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.531991Z","title":"Retinex-inspired unrolling with cooperative prior architecture search for low-light image enhancement","venue":null,"work_id":"11e01119-0a98-4c6f-8062-851b96003441","year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.009102Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:4caa7b85c757f3afd75226115ccfc992651e61857ba6a2f9760ad177a2e82e53","observation_id":"8c889a7f-4fe5-4376-b0fc-a079288a3226","resolution":{"observed_at":"2026-08-11T18:40:23.536749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.513774Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":"f38d1da9-bb6f-4ff2-ab22-5e021297f8e1","year":2016},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.013950Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:9d68f56b3af73f3eac19f21a4210772dd34bc040c85dda507c3cf0bd82b3bc63","observation_id":"ee9993b1-19a1-49d4-89a9-784672706038","resolution":{"observed_at":"2026-08-11T18:40:23.523162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.483205Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"2c4844a1-e73a-417c-b63b-4ad333d77051","year":2018},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.022841Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:4ae67e78e3181b91d40f23a8ec6b2e5025d847006455f869dfca353b81daf378","observation_id":"78a68820-7c24-4602-8e0c-86c4c0a60891","resolution":{"observed_at":"2026-08-11T18:40:23.492004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.451716Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning","venue":null,"work_id":"21043b03-c44a-4baf-8929-353da71c1e7c","year":2022},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.029958Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:6af8c4c28391c1aa1052986f5decb7e7a2c607f98722c9b3f12719d53b4247ca","observation_id":"a23ca64a-d0e1-4f27-9215-6301de439714","resolution":{"observed_at":"2026-08-11T18:40:23.461142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.432382Z","title":"X-clip: End-to-end multi-grained con- trastive learning for video-text retrieval","venue":null,"work_id":"e75b0791-5c60-44c8-898a-9aeab0d96368","year":2022},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.039956Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:e7019658b4aeca51ac33bf7a08db02b14cc5029bf73093260c91172d99f9b606","observation_id":"ee2f2e22-5a24-44d1-a06c-883deee273bf","resolution":{"observed_at":"2026-08-11T18:40:23.441679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.392393Z","title":"End-to-end learning of visual representations from uncurated instruc- tional videos","venue":null,"work_id":"ce42a77a-1ab4-4c1a-801e-b0968e3be0eb","year":2020},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.045764Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:6446da84fed00e8f152d7bc897674da1108e1884405adbebab31ae049720c5b8","observation_id":"e2abef21-70a8-4a9c-bfad-dc77572e9c03","resolution":{"observed_at":"2026-08-11T18:40:23.412625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.357115Z","title":"HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips","venue":null,"work_id":"b636a493-f32e-46f7-a604-cd0b51b4d467","year":null},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.052408Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:30395cfec556f07cd6e1d7b87829b61db7a4f72d2b941dafbf627571aae4142d","observation_id":"8e2154c4-c4e3-4eb8-8a58-997ada5779eb","resolution":{"observed_at":"2026-08-11T18:40:23.374584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.334426Z","title":null,"venue":null,"work_id":"baaffa77-ed3d-4aa3-82fc-a36ddfdcb0b7","year":2019},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.059032Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:db081be6f12d83a98ac105c419e8a1b13da26f4f16e738f8555ae32dd6499ae6","observation_id":"dc123eb7-8a58-492a-a5d1-cb67a5a964a5","resolution":{"observed_at":"2026-08-11T18:40:23.343505Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.312323Z","title":"Slip: Self-supervision meets language-image pre- training","venue":null,"work_id":"7de06e70-a045-4e69-9391-82a3456a1d96","year":2022},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.064479Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:7518359475b0e17fe9ee30b460dee41172c7c7b53291f650512da0edebd50b47","observation_id":"cef34cec-a4e9-4292-85e6-6e4926a25ecf","resolution":{"observed_at":"2026-08-11T18:40:23.320171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.291439Z","title":"Keeping your eye on the ball: Tra- jectory attention in video transformers","venue":null,"work_id":"00a72f51-fadb-4ff5-92d2-a7776bec436b","year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.068892Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:99e47a4e5f1cdd49103dcba9f61fc47bf5420065803dc2ea92b8065037dece0f","observation_id":"79a35dd4-7a64-46fe-a56b-0bc4207a3e97","resolution":{"observed_at":"2026-08-11T18:40:23.297289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.113399Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"328689e8-7164-47a6-86d3-98e8b2597159","year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.074970Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:3e61bd3474c8ee62dc1e5436ebc5a1d6f4fb0e59ed5c1b78308e1ee503c06172","observation_id":"201ee4fa-1134-4e8b-86f7-fa24e8dc2366","resolution":{"observed_at":"2026-08-11T18:40:23.121481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.089127Z","title":"Movie description","venue":null,"work_id":"414812d0-7f97-4cb3-b396-a30f6943a69a","year":2017},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.084101Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:ecc42c6e74ffc9234ca8674bc1793a271aff2125a5f147fe160dc63c0dae1721","observation_id":"5caf0299-3444-4b8c-a6ab-42d316724101","resolution":{"observed_at":"2026-08-11T18:40:23.098320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.071664Z","title":"Actor and observer: Joint modeling of first and third-person videos","venue":null,"work_id":"fab4228d-7078-4625-87d3-d905dd1e1e7f","year":2018},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.092041Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:b225fe673c93947ffd41fc473f933b3766d606bef5cf77e2674ee3d834705007","observation_id":"97dabd7e-7888-4e23-873a-3567774d950d","resolution":{"observed_at":"2026-08-11T18:40:23.076278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09626","last_updated":"2018-04-30T16:57:00Z","snapshot_observed_at":"2026-08-07T16:08:52.487917Z","submitted_at":"2018-04-25T15:30:27Z","title":"Charades-Ego: A Large-Scale Dataset of Paired Third and First Person Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.09626","snapshot_observed_at":"2026-08-11T18:40:22.101057Z","title":"Charades-ego: A large-scale dataset of paired third and first person videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.101057Z"},"links":{"cited_paper":"/paper/1804.09626","citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:fae92ff0a6d8e5b0731fb4b10908a9a04406df55aa677558da9a3094de8927a1","observation_id":"1eccf011-45ad-4296-a59b-3a6c2129d3e3","resolution":{"observed_at":"2026-08-11T18:40:22.101057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.051792Z","title":"Videobert: A joint model for video and language representation learning","venue":null,"work_id":"d70bad6e-62c2-481a-ae42-6e53ce95223b","year":2019},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.106058Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:e62e12f89987a57bb0474fe1487aaff78a5d6725bbf1ca5e3753ce8e1d8b377b","observation_id":"5bcd8913-db3f-42d7-bdf0-bd88170d5c2e","resolution":{"observed_at":"2026-08-11T18:40:23.057996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.031177Z","title":"Long-form video-language pre- training with multimodal temporal contrastive learning","venue":null,"work_id":"c7a26b42-0767-4bc3-b2e9-7ef6f7fb8258","year":2022},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.110282Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:f2a4317396ff3774f745541915e59d2d384d1845af52a98696069a0bb2530eb6","observation_id":"035e5820-11a0-45af-b166-02439be83035","resolution":{"observed_at":"2026-08-11T18:40:23.038963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:23.012228Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":"8ec215d1-dda5-4877-bb5f-3515c1a3e118","year":2019},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.114774Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:aa09625a033d9712bdd66e6def834ceb95d7e117aeaac0b9da7b2906ac57a873","observation_id":"4b7db35b-33bb-4347-990f-56ed75b03109","resolution":{"observed_at":"2026-08-11T18:40:23.018025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.986288Z","title":"Perceiver-vl: Efficient vision-and-language modeling with iterative latent attention","venue":null,"work_id":"7addcdc3-7984-40a3-91db-7b8dc04a4957","year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.119567Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:8ed43c3af2b224b97311ab6f60db3c02d3246032cb1b1257888bc23388b0a92f","observation_id":"5354a18e-c39b-4408-b1c7-d3eba3df0e71","resolution":{"observed_at":"2026-08-11T18:40:22.994481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.127678Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.127678Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:3a709df87f046d8699f37063a8e93dc369c38dfbcb7d8cab43d76821ab55cdf5","observation_id":"12a33b53-98b0-43d8-b5df-db60e4f26e4f","resolution":{"observed_at":"2026-08-11T18:40:22.127678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.953928Z","title":"Yfcc100m: The new data in multimedia research","venue":null,"work_id":"be08eca2-d924-41cf-ad08-80dfad56a66c","year":2016},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.132114Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:51ce084a094494c2aaac78466605561d430f704a924bccb27166bdcf079fcab7","observation_id":"d1d96876-a14c-44df-889e-60819aed4134","resolution":{"observed_at":"2026-08-11T18:40:22.960559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.136523Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.136523Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:ffb19a4c2ffa5b5a07e3d5025cf0dbf911bc55c390d0de4e92296a34d237c087","observation_id":"2bcaf4c2-a33b-4e66-84dc-5b170c1722b7","resolution":{"observed_at":"2026-08-11T18:40:22.136523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.922091Z","title":"Selective structured state-spaces for long-form video understanding","venue":null,"work_id":"25dda843-2162-4514-9ea3-e45be8b13cf2","year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.145845Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:9f5512fa883345e06d05421730d5fdb73448708374fdba492b2c24e393638e43","observation_id":"ab75073f-9ea2-4f39-bbb0-234ffc962ceb","resolution":{"observed_at":"2026-08-11T18:40:22.928282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-11T18:40:22.150840Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.150840Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:3e92501f12c73c26dacfd0b6e291eb7d1d778a348a7185c4365ae39706b89b22","observation_id":"4a3faca8-1c04-4fe0-827a-19d99d598132","resolution":{"observed_at":"2026-08-11T18:40:22.150840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13704","last_updated":"2025-02-25T01:51:06Z","snapshot_observed_at":"2026-08-11T09:13:12.400485Z","submitted_at":"2024-08-25T02:01:38Z","title":"DHP Benchmark: Are LLMs Good NLG Evaluators?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13704","snapshot_observed_at":"2026-08-11T18:40:22.157060Z","title":"Dhp benchmark: Are llms good nlg evaluators? arXiv preprint arXiv:2408.13704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.157060Z"},"links":{"cited_paper":"/paper/2408.13704","citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:1fb9e0d17a2135552191842aa97db04f6d694aa2e5c467b64d3905486c3be67c","observation_id":"73d944d8-079b-4d01-a357-36b6102fedcc","resolution":{"observed_at":"2026-08-11T18:40:22.157060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.899448Z","title":"Unified coarse-to-fine alignment for video-text retrieval","venue":null,"work_id":"fc2408ee-dbfc-49d6-a645-0ece68a44c89","year":null},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.169841Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:c4dae30cf844c6468a07b768b327f5485efd358506e7bddf0391ce9e010735cd","observation_id":"ce0bbc7b-c8f3-4d86-9372-7f6bd640d9bc","resolution":{"observed_at":"2026-08-11T18:40:22.907410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.880081Z","title":"Towards long-form video understanding","venue":null,"work_id":"bd831bf6-3e11-40f4-859c-930bfdc3d0d8","year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.179293Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:ef5fad3a2e81626dee12cf71898bc4a4948be90646d07b3b6c41a32806113349","observation_id":"0217e50e-9914-4bfe-a08f-03f1b55941d3","resolution":{"observed_at":"2026-08-11T18:40:22.887915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-11T18:40:22.188066Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.188066Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:bea062ed7cf2025e3ad56efebdb1daf2899ad7b4a32a1f595f40112be7ec590c","observation_id":"af4a49fd-e24f-4298-a8e9-0d1986020330","resolution":{"observed_at":"2026-08-11T18:40:22.188066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.835498Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"c46373d6-ff2f-4085-9ebb-33cd676f7cb3","year":2016},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.195527Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:c3d0a7193ac686a1437966173410e7fa4f89433058251da0239f02ef5556d369","observation_id":"8634cbef-9b21-4947-afe3-a6ee2c5d0267","resolution":{"observed_at":"2026-08-11T18:40:22.853043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.801073Z","title":"Ad- vancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":"35b38aff-900f-4c8a-a3de-af0c1116b605","year":2022},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.199428Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:eca66384b3ea448bac302151764be5b14fa436457bc3b2b3104771d08167c0ae","observation_id":"12f45cdf-17c8-487c-b5ef-6ee4bd4c4d86","resolution":{"observed_at":"2026-08-11T18:40:22.808404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.783272Z","title":"Clip-vip: Adapting pre- trained image-text model to video-language alignment","venue":null,"work_id":"b8d74937-5b83-47f8-875d-30e4347fd635","year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.203386Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:73164949fc0a31b2506df7710718ee23af441ee6573ca41135235785dc575105","observation_id":"c95dff12-9dd3-4d14-a1da-b3f0b253e691","resolution":{"observed_at":"2026-08-11T18:40:22.788021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.212547Z","title":"Just ask: Learning to answer ques- tions from millions of narrated videos","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.212547Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:1bca4de8a294615b91080481687d2a1040c06aaa8c2d826525f1984a7d0d9680","observation_id":"fe072311-6922-424c-8289-b740a55c263e","resolution":{"observed_at":"2026-08-11T18:40:22.212547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.218117Z","title":"Zero-shot video question answering via frozen bidirectional language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.218117Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:3f9a6624f4df0bd181726c993d8f9bbc712f1a74f4c6534ddf92ffb58c5172e4","observation_id":"f430c376-b266-4521-b89d-a5dc611e5127","resolution":{"observed_at":"2026-08-11T18:40:22.218117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.726354Z","title":"Taco: Token-aware cascade contrastive learning for video-text alignment","venue":null,"work_id":"9afb1f61-f5e6-4e10-aaa3-1247d9682fcc","year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.223480Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:224d9fe03ee1283ea9675aa17c9f161a856b2d6e255c8bacda38a30195867935","observation_id":"bb140d43-9d0b-4397-9990-cf86e245ea77","resolution":{"observed_at":"2026-08-11T18:40:22.735572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20299","last_updated":"2025-01-14T16:38:36Z","snapshot_observed_at":"2026-08-08T14:38:53.836623Z","submitted_at":"2024-05-30T17:46:23Z","title":"Scaling White-Box Transformers for Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20299","snapshot_observed_at":"2026-08-11T18:40:22.228956Z","title":"Scaling white-box transform- ers for vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.228956Z"},"links":{"cited_paper":"/paper/2405.20299","citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:aeeaf51af2be790b992dfda527c9bb670d3f0a3b8a7b0af1aa47cd613cfbd004","observation_id":"37292d9b-0b3b-4440-8f52-346e291a77df","resolution":{"observed_at":"2026-08-11T18:40:22.228956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.706854Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":"dfa63ddc-9888-4695-b9b0-912a1762e176","year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.235771Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:2a6962a0600b21acdc0ad438fd923a462637ed6353b65270a498363f87ad9578","observation_id":"b577bacb-e363-45ca-a5be-e2f1cfe3a8c4","resolution":{"observed_at":"2026-08-11T18:40:22.713450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.679785Z","title":"Hitea: Hierarchical temporal- aware video-language pre-training","venue":null,"work_id":"a0f789fe-8950-4b7c-8b4a-8f69ff411df6","year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.241823Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:28f14146908d52ced69e04338668bcce31f7ba076b1cb5f609db1498f7ca568d","observation_id":"a2ed1c0f-67f9-43c4-815c-4c1447826737","resolution":{"observed_at":"2026-08-11T18:40:22.685272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.246253Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.246253Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:8ca81f822449224baa49055ec0894815a8d334c5b671433d5d5a2737d5ee0e7a","observation_id":"5dcc4eb2-2123-4225-b95d-e4cab5cdf4cb","resolution":{"observed_at":"2026-08-11T18:40:22.246253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.648744Z","title":"Learning from inside: Self- driven siamese sampling and reasoning for video question answering","venue":null,"work_id":"a2ed30f2-63c2-4145-b993-268d69f8f465","year":2021},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.251821Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:d8d8c3363c4b4518c12001093de56392b55688b698084229e05c8a3a5f3f09eb","observation_id":"45c29bbd-b6da-4944-a25c-ea7bac2ae2ef","resolution":{"observed_at":"2026-08-11T18:40:22.654086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.625145Z","title":"White-box transformers via sparse rate reduction","venue":null,"work_id":"ed1268ca-7070-400d-a44a-d3d1d06f6f0c","year":null},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.256512Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:a478a6a4ea8970d2868f396589f4653c53c980f634bb19d8eca5fd1481deaf90","observation_id":"78cc4f21-adba-4b55-b2e0-e883298bb3e7","resolution":{"observed_at":"2026-08-11T18:40:22.634547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-11T18:40:22.261203Z","title":"Bertscore: Evaluating text genera- tion with bert","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.261203Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:6d3776de1ba243252f080c07368085a7f07fe0137b2f3d07f6123d6b4a0b8cd6","observation_id":"f07426f0-cd41-48c7-9ff9-d8d981f15060","resolution":{"observed_at":"2026-08-11T18:40:22.261203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.601629Z","title":"Videoprism: A foundational visual encoder for video understanding","venue":null,"work_id":"c8d8508e-5a28-4a62-b2e6-3e8e627187bb","year":null},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.265966Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:c4574cb73560fd49888d3a2d3629d2d34dbca86de8972972abaf09a4bf625204","observation_id":"1946b448-e8db-4ff6-9c31-a3e64bfe55ab","resolution":{"observed_at":"2026-08-11T18:40:22.608376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.583181Z","title":"Cen- terclip: Token clustering for efficient text-video retrieval","venue":null,"work_id":"6860022c-43f8-4fe6-a7f0-961132eb8a49","year":2022},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.270685Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:dd283430030ce89159ab35084737f4a75c43442a66b9c261c13a38c3da6b0d2c","observation_id":"c9a9235e-43b2-49bc-a573-5842e84d09f8","resolution":{"observed_at":"2026-08-11T18:40:22.591220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:40:22.562253Z","title":"P Xing, Hao Zhang, Joseph E","venue":null,"work_id":"46ab2bf3-b2e4-4a29-8760-0b96fc3c7b5f","year":2023},"citing_paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T18:40:22.275159Z"},"links":{"citing_paper":"/paper/2412.07704"},"observation_digest":"sha256:b0a772f7c7bddb8f8872e030f3f831c110cfa6c2d155d527ffdb359de1f5f8aa","observation_id":"d237a457-aeb9-4f15-a5ed-e7d2a9bc79ae","resolution":{"observed_at":"2026-08-11T18:40:22.568705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.07704","last_updated":"2024-12-10T17:50:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T06:35:46.949113Z","submitted_at":"2024-12-10T17:50:53Z","title":"GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":55},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2412.07704."}