{"as_of":"2026-08-17T15:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e7f6451a9a64ff6d8fe8ec85dee4104b9ebb349805783f53e11586f3b19f0f0","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T18:53:57.300531Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T19:59:19.860529Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08566","snapshot_observed_at":"2026-07-14T13:48:36.708969Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10165","last_updated":"2026-07-11T07:12:07Z","snapshot_observed_at":"2026-08-15T04:00:35.998690Z","submitted_at":"2026-07-11T07:12:07Z","title":"EmoStyle: Affective Conditioning of Style-Specialist Experts for Emotional Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T13:48:36.708969Z"},"links":{"cited_paper":"/paper/2606.08566","citing_paper":"/paper/2607.10165"},"observation_digest":"sha256:d98663435dbc164acfae9c878ef62cb7fd8278abd65334be17d0ac5c9a581a77","observation_id":"932542d8-a3a2-4169-a22f-4abbbbbbeea3","resolution":{"observed_at":"2026-07-14T13:48:36.708969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08566","snapshot_observed_at":"2026-07-14T12:58:07.349876Z","title":"Towards Accurate Emotion-Attributed Video Caption- ing via Fine-grained Emotion-Cause Pair Extraction, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10278","last_updated":"2026-07-11T12:18:53Z","snapshot_observed_at":"2026-08-17T11:10:36.676024Z","submitted_at":"2026-07-11T12:18:53Z","title":"Geometry-aware Gaussian Prior and Axial Attention for Cervical Cytology Image Classification","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T12:58:07.349876Z"},"links":{"cited_paper":"/paper/2606.08566","citing_paper":"/paper/2607.10278"},"observation_digest":"sha256:b961a5aa2dad97fab4865d9c410941d9c9c3d45767fa22af29c9ecf00d973e99","observation_id":"cef63516-d1ba-46d6-a4d9-4013f1b08080","resolution":{"observed_at":"2026-07-14T12:58:07.349876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08566","snapshot_observed_at":"2026-08-01T19:59:19.860529Z","title":"Towards accurate emotion-attributed video captioning via fine-grained emotion- cause pair extraction,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16787","last_updated":"2026-07-18T11:49:40Z","snapshot_observed_at":"2026-08-17T12:23:20.423614Z","submitted_at":"2026-07-18T11:49:40Z","title":"HTT-Net: Hierarchical Text-guided Transition Modeling for Surgical Video Phase Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T19:59:19.860529Z"},"links":{"cited_paper":"/paper/2606.08566","citing_paper":"/paper/2607.16787"},"observation_digest":"sha256:5dad1ffaa99d8944838492e5a24c141de79d0db82667768673fb0263f1f044ad","observation_id":"827fc6d4-a6fb-425d-aae6-910f65ee1df3","resolution":{"observed_at":"2026-08-01T19:59:19.860529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.08566/citation-record","integrity":"/paper/2606.08566/integrity","json":"/paper/2606.08566/citation-record.json","paper":"/paper/2606.08566"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Mdkat: Multimodal decoupling with knowledge aggregation and transfer for video emotion recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:9df7134418e24da204211d97ca63794bed7979a4318432e9877d72c0ae5451dc","observation_id":"592df09a-62b9-4d39-977c-40a35a77d76d","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Feature evaluation and joint interaction for audio-visual emotion recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:7bba2f5d9c115a4771a652e244fbb687f7b176b926cc4e1da7ed3e53a23368c7","observation_id":"a9520a1d-ce63-419b-ad84-3fc801c0d4b3","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Glove: Global vectors for word representation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:3def63d33633bcaea81a01abbb4c540c874b4b2540c3852b62b38a2b88adf3e8","observation_id":"10d641bd-8eb1-4af1-9371-f9f0cbb1e085","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Weakly supervised text-based actor-action video segmentation by clip-level multi-instance learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:42c9c8ec0c183bbd3046c006997a3cf6d4544b8f331f9d2418970d8d7870fafd","observation_id":"465dab71-b3bd-4f72-8dde-ce4e3b4c9949","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Graph mixture of experts and memory-augmented routers for multivariate time series anomaly detec- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:a7cf012e9769d8f91d2b515ae60eca84ecf9688e22478986dd22855190d094bf","observation_id":"89156e58-57c0-4662-8bef-4df5b18d54d7","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:5a22e376d9826aeabeda56a56b52e2675a8d0e5288a6b0dddde576920eb9d395","observation_id":"ccbac76a-39bc-4c79-ad36-043967f366ae","resolution":{"observed_at":"2026-07-02T22:27:25.971841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Ecpec: Emotion-cause pair extraction in conversations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:e893a15df7d908b6d8cc45ad47f2fe06d589b656c04c31c292692db5e307090e","observation_id":"5476de3a-4007-4713-b712-c8c019c6e852","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Multi- round mutual emotion-cause pair extraction for emotion-attributed video captioning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:4cd4258538df3eb821a455b8564e5cb178d01bac3b42696bf4b9c95bd94a3aeb","observation_id":"357faf6b-6cec-4f41-8e95-64fffb99ef5d","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Global-view and speaker-aware emotion cause extraction in conversations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:9c5db14ca01b722b5cfe6643783839d0c2970ea52ef192021917e5207d401f6d","observation_id":"550a8329-a2c6-4058-8e98-ccfe3326dd2d","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Multimodal emotion- cause pair extraction with holistic interaction and label constraint,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:0d0552d79f9196702dc242fde82288b4c8a61376bea8fd03b5143d22a4e6ca9f","observation_id":"0ab00d3f-fa43-4639-8fa1-48fc08464af2","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Reconstruction network for video captioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:ba9424469a3991c350d1862ebf6b442efb8af7827fc1b48914270d63b09636af","observation_id":"14b3edcd-bef0-476f-af15-c1f97bc05aad","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:f34a00f6effe63c6384c345f569ee26c77531703ea3f60aee070c13a7c182d32","observation_id":"cb8ed6e9-0f93-4ee0-a706-21a8440474ee","resolution":{"observed_at":"2026-07-02T22:27:25.979582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Enhancing emotion-cause pair extraction in conversations via center event detection and reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:b729ad2d0260f007de9767ce8a41d0148bc5fdd169c9f77c0d5d219937655cc0","observation_id":"e8587893-5761-4214-903d-e7022f36bf2b","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Prompting video-language foundation models with domain-specific fine-grained heuristics for video question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:7d6dcb734dd8cfff3f8d1eec9939c5b929324675216a4986117fca01c896db93","observation_id":"4eaf246b-8fe6-45d5-9e78-91c3cc83b81f","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Meteor: An automatic metric for mt evalua- tion with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:ad5cce8da3dd12b409eb88abb9f40b38979d960b5327921f3bb5bdf6c902c369","observation_id":"bf8100fe-2677-4c30-97d6-90eda88882d4","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:1e37c78f16db53b632562918c0760fc2f13334a32ce03544e5435bac8e452a05","observation_id":"09ee6374-7aa1-4fc3-8392-775cbc48e1e3","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:821715c4077f961f2b65441519f302956e7edd952e171ffd27add633bed77857","observation_id":"52cf7334-9ad3-4671-857f-d1845087f8d7","resolution":{"observed_at":"2026-07-02T22:27:25.977100Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:b13008ad34c04991150560aab8824af1ef5dbaa9000b534816b969b69a31385d","observation_id":"1e1c7547-9adb-4b34-99bd-1779156efc9e","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Learning probabilistic presence-absence evidence for weakly-supervised audio-visual event perception,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:a0daeb044b7623c8200f5671f8958d623c4095844408c50fc588febc9c6cd1da","observation_id":"ddc21777-16ca-41d0-8cbf-29bf4495ea22","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Expllm: Towards chain of thought for facial expression recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:9a0fb01f7baf181273b99769927c0477e4ad4b5454f70ab017c11f82a652dad1","observation_id":"8f6d043c-06e7-424f-af30-ae954c78f60f","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Benchmarking micro- action recognition: Dataset, method, and application,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:fa27cfed2356a546e91d684d2a89165734bef9e8385dbdd5b77b2bdf272b80e7","observation_id":"8e900c65-4caf-4b48-9236-62c42662d63e","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Contextual attention network for emotional video captioning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:b37d469158ae67d8ded73fba9cb25a8394ebd668a230a9457fb08b8720497803","observation_id":"bc5e89fb-4b1b-4ade-b632-56837bb26b92","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Observe before generate: Emotion-cause aware video caption for multimodal emotion cause gen- eration in conversations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:a1a2c34e41c5a2e8684f8d5ef677f8241dc3a9d4e157f772e5bdedb72bf759f2","observation_id":"6ee6c3bb-369b-4f0d-aeef-688827c5d124","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:5a35e0d239fbf9d26775b71ff9285797234760f33cde4ff333a9783f76c3c9e8","observation_id":"d370b28d-9371-469b-801b-9a4f8d8c1e53","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Cross-modal coherence-enhanced feedback prompting for news captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:c50633b93dd08206d856394e2968005e47c688dae1756e2b6c6955ecd1825efc","observation_id":"52b67f99-e9b3-4c85-9475-ad18d6bf1711","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:cea4c59e1f4ae8a9f7b78ad3c21879f3cfdd7a76f6405bafbbf08dea7ba071ae","observation_id":"ddce4da4-0de3-4173-89d5-4ac28ebcf786","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Semantic grouping network for video captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:40eed25114b2e3118707057d8ccfb092970a48c34b1c92f9acf56f0d827478ab","observation_id":"4a73872e-72ad-443c-b33e-ea616e1c17cc","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Rule-driven news captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:aba2b52e34891ef2db1d72f24025ead4812da0db868c6c1c35c0815868f48b0c","observation_id":"e329f73f-c7f2-4dbe-817f-23b5e2550064","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Eliciting in-context learning in vision-language models for videos through curated data distributional properties,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:c0bd55d90c6d8ba97aaca3e111d9b59de1b4fd8ed593e344b531e96a15a74af6","observation_id":"e33f43ca-6c4f-4074-affc-d1a334066fb4","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"A versatile multimodal learning framework for zero-shot emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:6b234298660c2c6e4cbf0342a535ecb4b7155dcc5a30a9e98aa24eda132addae","observation_id":"1f8ef91f-4d3e-411d-bc4c-a5fab71d6307","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Cascade cross-modal attention network for video actor and action segmentation from a sentence,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:7ed55d6ed146935bcd4da0f487610f19e8fc895ddfc78ce5b09705aeb5e4bffe","observation_id":"93be78e6-8ada-4b33-aaf9-33959f4de274","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Emotion-cause pair extraction: A new task to emotion analysis in texts,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:3c38e0284d6e5d9666c14892772500e07d635af99d15564412d9db001361d65c","observation_id":"51c51306-eb7c-410a-a876-d9a9b72ded4e","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Collecting highly parallel data for paraphrase evaluation,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:f0e42d0d1eb4f88422796b9c0a5e988c4e848389d9b30489fe2d5ba2718749de","observation_id":"40800fc4-c3e5-4751-8452-f0935f7ba9fa","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"From coarse to fine: A distillation method for fine-grained emotion-causal span pair extraction in conversation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:ed399864b4477440724ae2d7e1eee15d8ffda30cdbaeb4d6e2c74d0f0fe9403d","observation_id":"c924b1db-9ea0-465c-a82a-e9c15305fadf","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"From extraction to generation: multimodal emotion-cause pair generation in conversations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:33e9a8539528bb85d1a2c97f7366b2140b61cc1c4cb04870a0dfb3323a981922","observation_id":"714a911b-6f89-499a-8fdf-a2a5f34cd025","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Improving image captioning via predicting structured concepts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:09a3c129f70634b4568b2c0c4596373fa32277c18a67474290ecfded6f9eea78","observation_id":"c4cc4550-738e-426d-875a-526872d03bb8","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Bootstrapping large language models for radiology report generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:40afe63e06059d9c8c332102b8997b51b47958167e7630cb7c89e766534b32e9","observation_id":"a81cdc17-dd6b-46bb-9a87-d74328cb3014","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":"2501.13106","doi":"10.48550/arxiv.2501.13106","metadata_source":"pith","pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","venue":"cs.CV","work_id":"38f52461-37fd-4266-bc46-9dea31be2824","year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:3a047a6b03fc883eb4fc0b0feba2b472abb3b827a22def55742c44a8a1f765db","observation_id":"cd5acfcd-393c-4181-890a-4c0335f0bcf5","resolution":{"observed_at":"2026-07-02T22:27:25.974508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Improving radiology report generation with d 2-net: When diffusion meets dis- criminator,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:f0c70b52bf7b01afae211b60dd65492bf6573e7f33bc038c28e1f8e40dbfd785","observation_id":"6bf84976-00ca-495e-82cd-197ee6e6fed7","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Improving radiology report generation with multi-grained abnormality prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:cb1ce7d6b711968c378dde138ca5bc5a54a290ee84896eca75f22267d2ab2f2e","observation_id":"89c4b020-c1c7-44e7-90d4-ca7abeb2d1a8","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Enriched image cap- tioning based on knowledge divergence and focus,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:083664d51fe8ee4a5f39cfe08ef6e57b2d75adc9096a12b8cb07063ec9e3b27f","observation_id":"d3058131-ee76-439d-9a64-5900f2ac94f2","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Emotional video captioning with vision-based emotion interpretation network,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:9a5fc228cea5213625195751da443f1918d43764789baceac5d362a957538986","observation_id":"134c1104-5ab5-47e7-a899-c93bdb75713c","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Emotion- prior awareness network for emotional video captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:7b7640d592112d3011e86c150e220efa3bf984479a1f33479c1a1fd7e7858765","observation_id":"66caae5c-97a8-4ef8-b70e-0f26ac6dbc68","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Combatting data imbalance and noise in micro-action recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:57bd5e41f45ab2ea693fbfc2a2923505250bec6e6dabc785811711b5fcd5ff41","observation_id":"59614382-fde1-450a-ab52-fa6a62e0cd88","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Eliciting in-context learning in vision-language models for videos through curated data distributional properties,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:62c5ee635bfefc1b086d58d59adef2fca4dcf684fb02e9ca3f8c4a33b5a70f40","observation_id":"d9a9ee7a-c80d-49e1-80a7-8dae8c425877","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Obtaining reliable human ratings of valence, arousal, and dominance for 20,000 english words,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:b680faf3f20c1242a93aa9c00c062cf36db0b075f1023c755f07e44258e58227","observation_id":"2e9a73e7-761d-4fd5-9ee7-b4b721e91040","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Linguistic-aware patch slimming framework for fine-grained cross-modal alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:914bec2b111e42cee39d1084a63ff0cb2c3611c40cdd33e255ef18ede4a034d8","observation_id":"961a1ab3-11eb-408e-a420-07008ebe47d4","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Emotion-oriented cross-modal prompting and alignment for human- centric emotional video captioning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:0dbb0a30b96d6ffdcc4f18717248c5fa71f97d00c807cc40adbcda916bcea933","observation_id":"21dc0f3a-87b9-4028-a323-387ab8b1fa25","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Dual-path collaborative generation network for emotional video captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:b59ed0665b413bb5904c6b8dde53045e03ef90ea9361a8ce6af2948f75843765","observation_id":"3ce3a258-af13-4c16-8b20-037ea4dade00","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:d7a5576dd9c5f40b4b7079a5e7bf2585e8bc1008163b1d639955adb58848ef8f","observation_id":"5b05a019-abee-4f49-9969-aad0aa093855","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"A knowledge-guided graph attention network for emotion-cause pair ex- traction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:c32399f737136d1b059a5cf370c7e3b03e96602466412751d7c167c825ef7de6","observation_id":"fe8bb236-7672-4e39-b7e8-9d1cd63f69b9","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"A comprehen- sive survey of 3d dense captioning: Localizing and describing objects in 3d scenes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:352ac5fa96115baf5c37d1628376746a6d93cd602e56e5b15e03429693f51a1b","observation_id":"a48cf7b1-e8c9-4de4-94a2-a9ff311074f4","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Predicting emotions in user-generated videos,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:851869c03ea92448d150f06b41be815dcf9d351f128eb1ece6cee72f66e88f69","observation_id":"318f8aa0-b129-4aea-a06e-4720125b2b76","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Multi-attention network for compressed video referring object segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:723678f52815c259144b07c0be737605367cf7baeb29f8dd18d348e27dc2ddfa","observation_id":"4e2ff6a0-8b09-4040-b0fc-c7f14bb13a38","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Towards efficient partially relevant video retrieval with active moment discovering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:28a77decd84c98ac43c8aeeea0cd970e021900c71205c604aa2967e5b473e9b8","observation_id":"69c70fba-1c49-467c-9157-2cab1641f4f1","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Vectorized evidential learning for weakly- supervised temporal action localization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:8a6fccda1804d8e37e341f3df2fa3a204ead2fdcbbf382478d1eeee967c7fc6d","observation_id":"f03ab210-8308-4660-acb6-b751abe24ca8","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Sentiment-oriented transformer- based variational autoencoder network for live video commenting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:89eaf89aaf34a1f6366b815dd6a6aea9154c4765fd57a59e4ee66a4f985a68c8","observation_id":"2a7c8efd-e2a6-4049-81d5-61cc737c4199","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Prompting few-shot multi- hop question generation via comprehending type-aware semantics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:f5034444b778bad50832e016e7babd7008cc846fbf2476483193b2857eb39b5f","observation_id":"7fa533f6-2f98-45b7-a27e-5afb452db884","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Affectnet+: A database for enhancing facial expression recognition with soft-labels,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:e49aa5263943cd04add42f3e05de1b5748b42e69cd75bdba141764f5c506b705","observation_id":"08f17e4f-7d30-47c3-9aae-0ad120a8f86c","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Emotion expression with fact transfer for video description,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:b972e67082882b409972d8af2154a1298414bc8ac2db35a90333cd3bed9bb9e2","observation_id":"75904bad-a358-46dc-b846-65d92f1369dd","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Graph-based multimodal sequential embedding for sign language translation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:9224ac70a6ffb1d54a88325cad9ea4f7de41bf83b535d62df44b4c96dc35deba","observation_id":"41108cfc-9607-4209-924d-39d3ea81ca56","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Boost tracking by natural language with prompt-guided grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:7707e3c37e408dfe01d9320750aac80d4ed75162f95ab33751424d7b165840c8","observation_id":"75872f37-f97c-4c54-8349-4d822cee9796","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Multimodal emotion- cause pair extraction in conversations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:4fbbef82c43c7927a5334e777557d20cc66f2d98955dfef3f6be82ad3db8cb2a","observation_id":"182605e2-ccab-4724-bd15-d3a1ffbe766d","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:56f48a9414f76d0b9aa8bfc95cdd9c399fa1dd6be41d3df631d3e56d0e2e6e25","observation_id":"ef5c5014-5569-4cad-aed6-285abcf533f3","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Syntax- guided hierarchical attention network for video captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:7d496f62eeac308badc07e3be3c1c9e9c54a6cf681ea8dfb6183a9a177649342","observation_id":"3e13477b-133b-4019-a24e-5ef05d5b5d04","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Enhanced generative framework with llms for multimodal emotion-cause pair extraction in conversations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:dbb8b0f79c51408b6804bf7c351f44060e44ea3da13fdb64ee24d546ed017d0e","observation_id":"dd43d5e1-f421-4fcd-a462-45bd678f316b","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Improving video summarization by exploring the coherence between corresponding captions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:9a6b575fb309a70364268c7b6dfaab2c81694cf86baf3dbbe36a5a905c4d9bbb","observation_id":"e9323464-c30f-4b8b-a39f-0eb4d83caaec","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Emotion prediction oriented method with multiple supervisions for emotion-cause pair extraction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:be75823c2c7a82b2d6bf5f5614d168bf173a5df30965f6831f56d14406b21518","observation_id":"9cd40461-af6a-47c8-9ad0-f74ea2c030de","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"Subjective- objective emotion correlated generation network for subjective video captioning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:8db6f0d65f3fe2931c0fa62525fd3bbbe2ae2cd564232b9e702b456f1a4304ba","observation_id":"31e6d2c5-35ea-4588-89e7-e2db095fd644","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:53:57.300531Z","title":"He was a post-doctor with the School of Information Science and Technology, University of Science and Technology of China, from 2022 to 2024","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-27T18:53:57.300531Z"},"links":{"citing_paper":"/paper/2606.08566"},"observation_digest":"sha256:e4722b533c0a661a9ff3c7767b3ad95a2b72c5ff74eeb88c8470a7f672d0ad72","observation_id":"b83f9170-34c2-4e6a-a9ea-b0670e15d5e3","resolution":{"observed_at":"2026-06-27T18:53:57.300531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.08566","last_updated":"2026-06-07T10:43:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T15:16:08.420216Z","submitted_at":"2026-06-07T10:43:41Z","title":"Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":66,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 3 inbound Pith citation observations for arXiv:2606.08566."}