MCompassRAG: Topic Metadata as a Semantic Compass for Paragraph-Level Retrieval Paper • 2606.18508 • Published Jun 16 • 21
SproutRAG: Attention-Guided Tree Search with Progressive Embeddings for Long-Document RAG Paper • 2606.18381 • Published Jun 16 • 19
VAMPS: Visual-Assisted Mathematical Problem Solving Benchmark Paper • 2606.04244 • Published Jun 2 • 6
SimMark: A Robust Sentence-Level Similarity-Based Watermarking Algorithm for Large Language Models Paper • 2502.02787 • Published Feb 5, 2025 • 6
Targeted Adversarial Attacks against Neural Machine Translation Paper • 2303.01068 • Published Mar 2, 2023 • 6
Targeted Adversarial Attacks against Neural Machine Translation Paper • 2303.01068 • Published Mar 2, 2023 • 6
SimMark: A Robust Sentence-Level Similarity-Based Watermarking Algorithm for Large Language Models Paper • 2502.02787 • Published Feb 5, 2025 • 6
VAMPS: Visual-Assisted Mathematical Problem Solving Benchmark Paper • 2606.04244 • Published Jun 2 • 6
ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction Paper • 2605.11212 • Published Jun 5 • 5
BCAmirs at SemEval-2024 Task 4: Beyond Words: A Multimodal and Multilingual Exploration of Persuasion in Memes Paper • 2404.03022 • Published Apr 3, 2024 • 2
UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs Paper • 2606.06622 • Published Jun 4 • 22
LM-CPPF: Paraphrasing-Guided Data Augmentation for Contrastive Prompt-Based Few-Shot Fine-Tuning Paper • 2305.18169 • Published May 29, 2023 • 3
InsightBench: Evaluating Business Analytics Agents Through Multi-Step Insight Generation Paper • 2407.06423 • Published Jul 8, 2024 • 2
BigDocs: An Open and Permissively-Licensed Dataset for Training Multimodal Models on Document and Code Tasks Paper • 2412.04626 • Published Dec 5, 2024 • 15
FM2DS: Few-Shot Multimodal Multihop Data Synthesis with Knowledge Distillation for Question Answering Paper • 2412.07030 • Published Dec 9, 2024 • 1
StarFlow: Generating Structured Workflow Outputs From Sketch Images Paper • 2503.21889 • Published Mar 27, 2025 • 4
DRBench: A Realistic Benchmark for Enterprise Deep Research Paper • 2510.00172 • Published Sep 30, 2025 • 3
BCAmirs at SemEval-2024 Task 4: Beyond Words: A Multimodal and Multilingual Exploration of Persuasion in Memes Paper • 2404.03022 • Published Apr 3, 2024 • 2
UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs Paper • 2606.06622 • Published Jun 4 • 22