{"as_of":"2026-08-09T14:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e3c07c4781c6e99d7a9428cc9a102e5493bfda41752124d708eeeee9135c0cb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:40:21.599948Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:29:57.890361Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":171,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:c0e7ea85530f742f223305e7f8752c1f86f42ca7cc2aa3a1e7b7426f6e881024","observation_id":"03a6e17e-2b29-4780-b90a-e008cf09c589","resolution":{"observed_at":"2026-05-17T10:46:28.852840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T22:52:20.935555Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2407.12580"},"observation_digest":"sha256:a6ed4f52a4f7bd065354d01030f59c2a6baf99bb904632cc51e13e8deadf65f0","observation_id":"e14f8811-1c17-4665-b344-4424d20d57a6","resolution":{"observed_at":"2026-05-16T22:52:20.952536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-08T23:40:21.599948Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04076","last_updated":"2025-02-06T13:41:24Z","snapshot_observed_at":"2026-08-09T12:59:11.651183Z","submitted_at":"2025-02-06T13:41:24Z","title":"Content-Rich AIGC Video Quality Assessment via Intricate Text Alignment and Motion-Aware Consistency","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T23:40:21.599948Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2502.04076"},"observation_digest":"sha256:ae883db250cfad482d1eb474c82f2e9779f9cd53c01fbadb2ceb568764ee2848","observation_id":"6cb0ee77-9ec0-4717-8e75-9b406f2599c7","resolution":{"observed_at":"2026-08-08T23:40:21.599948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-08T20:06:35.217443Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-08T19:58:39.444110Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.217443Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:ea9680ee2d75ba7393334c81a7dc1ad1a3c5b0f5a252a8297f64a02d14b2bf85","observation_id":"5b51070d-d63d-4fc0-976a-77c714bd43a5","resolution":{"observed_at":"2026-08-08T20:06:35.217443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-07T14:25:55.385363Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.385363Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:45eb7b4ebdb50fe5f4799b6387655d6bf6b7a501113e61bb787a377c558306b1","observation_id":"1d6f4e5d-57fc-41b3-9b1f-fd9d40e586a1","resolution":{"observed_at":"2026-08-07T14:25:55.385363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-07T12:03:39.089363Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00868","last_updated":"2025-06-16T12:09:09Z","snapshot_observed_at":"2026-08-09T04:53:21.850036Z","submitted_at":"2025-06-01T07:17:16Z","title":"Multiverse Through Deepfakes: The MultiFakeVerse Dataset of Person-Centric Visual and Conceptual Manipulations","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:03:39.089363Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2506.00868"},"observation_digest":"sha256:d32333662b168e993a07fdcf1723c039844f66c90096f4a41db3a29538309e3e","observation_id":"766675df-dbfd-4115-975d-536f1a31855b","resolution":{"observed_at":"2026-08-07T12:03:39.089363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-07T11:27:47.273964Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02452","last_updated":"2025-08-24T13:14:45Z","snapshot_observed_at":"2026-08-09T07:32:39.576106Z","submitted_at":"2025-06-03T05:17:37Z","title":"ANT: Adaptive Neural Temporal-Aware Text-to-Motion Model","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:27:47.273964Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2506.02452"},"observation_digest":"sha256:6a1bb21a662750eff560062f5fd77158680314fce871d4fa4fb15dd8439e4876","observation_id":"5a9871a1-57b7-40e4-bd16-eda9ed779b15","resolution":{"observed_at":"2026-08-07T11:27:47.273964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-06T22:22:37.804567Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21839","last_updated":"2025-08-11T01:14:09Z","snapshot_observed_at":"2026-08-08T21:01:56.705550Z","submitted_at":"2025-06-27T01:08:37Z","title":"GenEscape: Hierarchical Multi-Agent Generation of Escape Room Puzzles","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.804567Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2506.21839"},"observation_digest":"sha256:0fddda46d45cbbf2c4ee4195c67ae49d254320f99387b214bc2b4a8b9c494ad5","observation_id":"38f709d8-3a45-402a-a049-1a51bc49f3f1","resolution":{"observed_at":"2026-08-06T22:22:37.804567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-06T17:47:56.501373Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-08T15:05:25.893427Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.501373Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:a3ccccdb7d816d34332a447f697a52e547d96905381acaca08e01928912a8320","observation_id":"d91d90a1-acd1-4d8e-ad0a-ea4de23d1568","resolution":{"observed_at":"2026-08-06T17:47:56.501373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-06T16:45:57.092222Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12755","last_updated":"2025-07-17T03:16:28Z","snapshot_observed_at":"2026-08-08T00:30:58.494371Z","submitted_at":"2025-07-17T03:16:28Z","title":"Domain-Enhanced Dual-Branch Model for Efficient and Interpretable Accident Anticipation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:57.092222Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2507.12755"},"observation_digest":"sha256:e8b6ac667e4b8863c29bf37848b48beb705424f61442ddd8734f598a671a2a41","observation_id":"7fecc64b-1d59-4c7c-9aa8-12589220b431","resolution":{"observed_at":"2026-08-06T16:45:57.092222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-06T16:22:49.772744Z","title":"Long-clip:Unlock- ing the long-text capability of clip.arXiv preprint arXiv:2403.15378, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13708","last_updated":"2025-07-23T13:00:06Z","snapshot_observed_at":"2026-08-09T01:02:26.043071Z","submitted_at":"2025-07-18T07:33:08Z","title":"PoemTale Diffusion: Minimising Information Loss in Poem to Image Generation with Multi-Stage Prompt Refinement","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:22:49.772744Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2507.13708"},"observation_digest":"sha256:c6bfaa9e14602dc375bab557e359bcf4ef702fa36f82a06d6de42be738ad3232","observation_id":"4160fdf5-77db-4682-8f0b-cf6b232dfb42","resolution":{"observed_at":"2026-08-06T16:22:49.772744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2509.22378","last_updated":"2026-04-16T08:15:21Z","snapshot_observed_at":"2026-08-03T13:59:15.066089Z","submitted_at":"2025-09-26T14:07:29Z","title":"Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T12:39:56.396231Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2509.22378"},"observation_digest":"sha256:8352ba0f98fa636fec11833d80bf528e42faea82abbd987d5abbcf3daf15dfba","observation_id":"c4c08ade-a215-4f17-8092-44de9aca2019","resolution":{"observed_at":"2026-05-18T12:41:22.671528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2601.14594","last_updated":"2026-05-07T03:54:39Z","snapshot_observed_at":"2026-07-06T22:42:26.083572Z","submitted_at":"2026-01-21T02:26:48Z","title":"LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T12:21:19.606631Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2601.14594"},"observation_digest":"sha256:b6ba34160e3b131eeb8969788a090fd6da72ea4e82cad064429a59b3696a4886","observation_id":"21865d75-2172-4a81-abe7-a9c3a11ce13c","resolution":{"observed_at":"2026-05-16T12:22:52.400078Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-03T04:50:56.206901Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04043","last_updated":"2026-07-16T06:28:44Z","snapshot_observed_at":"2026-08-07T04:07:07.677831Z","submitted_at":"2026-02-03T22:19:58Z","title":"AnyStyle: Single-Pass Multimodal Stylization for 3D Gaussian Splatting","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T04:50:56.206901Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2602.04043"},"observation_digest":"sha256:bc2005080aefaf6ad0e14ed359a3b90ac1db02283c79e49ac9b78b68f7459b43","observation_id":"b9a0f02a-d2d4-4809-99f8-99d96cc9c187","resolution":{"observed_at":"2026-08-03T04:50:56.206901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2605.02834","last_updated":"2026-05-05T09:59:53Z","snapshot_observed_at":"2026-08-07T22:39:16.868213Z","submitted_at":"2026-05-04T17:11:16Z","title":"VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T18:35:48.379198Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2605.02834"},"observation_digest":"sha256:414713c2faf37263ca3b7ce4d6c5ff4f2f121e6cd2dca347badc2345c0e371d7","observation_id":"5b837b95-8915-4b84-aca9-6f6f0cc107e9","resolution":{"observed_at":"2026-05-09T06:20:41.288367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:14.874049Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:b4ccd0340ae665435191365b122ae01e4dc4d19f2b65b95aa7bdb93f382d347b","observation_id":"84f41b62-ca6e-407d-8f7b-90a806f33b21","resolution":{"observed_at":"2026-05-15T01:53:28.725478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T21:54:33.902256Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:8986d9d0a764f09f28473e77077348764ae59e6d45c5e9af2a4da9ac329dcf47","observation_id":"62d63b4f-850f-4b2b-8183-983e4e591e26","resolution":{"observed_at":"2026-05-20T21:59:06.461323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T09:12:35.777810Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:1245e5a4cdc9201df05edddfd7913eb54e4c8a2a021c8308416bdd0783ae81ca","observation_id":"873a7819-028c-47e2-a0c4-a30081ab958e","resolution":{"observed_at":"2026-05-21T09:14:05.624844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2605.14382","last_updated":"2026-06-29T03:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:06:57Z","title":"Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T21:44:21.427570Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2605.14382"},"observation_digest":"sha256:d70b2008308838c06eb4f1af5165432f2504f317478fc3ee686359e4f095424f","observation_id":"65d9bc3f-5700-4c3f-847a-0ce1a24e5f20","resolution":{"observed_at":"2026-06-30T21:45:05.533477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2605.16241","last_updated":"2026-05-15T17:48:25Z","snapshot_observed_at":"2026-08-01T14:57:19.382384Z","submitted_at":"2026-05-15T17:48:25Z","title":"Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T18:41:12.533556Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2605.16241"},"observation_digest":"sha256:51dde1a49ff3342594d88db2fcb90296f7fa66d7e58d6a23f8d30b406c68e5b1","observation_id":"ac12bc4f-551e-49c0-9619-29fecc202c2d","resolution":{"observed_at":"2026-05-20T18:43:38.647922Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:5c83a77a83cd01959f2b79a9c3cd1d0d58c64dc2059c7f80d3c5a63d2b63a721","observation_id":"29d9322a-d926-4c8b-a69c-81a353b8bb01","resolution":{"observed_at":"2026-07-04T06:39:37.630748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2606.24253","last_updated":"2026-06-26T09:37:54Z","snapshot_observed_at":"2026-08-08T09:42:45.507846Z","submitted_at":"2026-06-23T07:42:22Z","title":"TuringViT: Making SOTA Vision Transformers Accessible to All","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T00:29:41.291832Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2606.24253"},"observation_digest":"sha256:957dfdd128273c295130ee8a9d9b8111a855ad31ae9b39ef97ad7ed4cec20952","observation_id":"ab0c928c-5f9b-456d-95c7-e6a77702e2f0","resolution":{"observed_at":"2026-07-04T16:29:57.891855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2606.24253","last_updated":"2026-06-26T09:37:54Z","snapshot_observed_at":"2026-08-08T09:42:45.507846Z","submitted_at":"2026-06-23T07:42:22Z","title":"TuringViT: Making SOTA Vision Transformers Accessible to All","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T05:32:26.746776Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2606.24253"},"observation_digest":"sha256:d184c68d7658cfe779ef08bdd8f71fe01ea83893306180c6a99fae505a880441","observation_id":"f8971470-a521-43ab-9a07-60b75aa612e5","resolution":{"observed_at":"2026-06-29T15:03:32.224194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":"2403.15378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-04T16:29:57.890361Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"2c800e27-f31c-4e52-a7c6-c004768dd7a0","year":2024},"citing_paper":{"arxiv_id":"2606.28421","last_updated":"2026-07-08T14:55:43Z","snapshot_observed_at":"2026-07-12T11:46:49.191265Z","submitted_at":"2026-06-25T17:14:03Z","title":"JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T01:02:20.024793Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2606.28421"},"observation_digest":"sha256:dde52d15f400a80ced1fff6cd021f09f4036b9a2faa3b80f81c49f4416f9e477","observation_id":"016f124c-dda2-4a77-b01e-e8e688f0ee17","resolution":{"observed_at":"2026-07-01T15:45:48.757577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-07-12T11:46:50.520083Z","title":"Long-clip: Unlocking the long-text capability of clip,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.28421","last_updated":"2026-07-08T14:55:43Z","snapshot_observed_at":"2026-07-12T11:46:49.191265Z","submitted_at":"2026-06-25T17:14:03Z","title":"JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T11:46:50.520083Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2606.28421"},"observation_digest":"sha256:1dc52cc46b5ff3c10c21e4d42eac44b0d9e76264ecf47d5f6ae21af48bd5f6fa","observation_id":"c9eee4a0-f03e-48e6-b829-770ae20f3b26","resolution":{"observed_at":"2026-07-12T11:46:50.520083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.15378/citation-record","integrity":"/paper/2403.15378/integrity","json":"/paper/2403.15378/citation-record.json","paper":"/paper/2403.15378"},"outbound":[],"paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2403.15378."}