text」の検索結果

566
githubGitHubあり2026-07-24

transformers — 🤗 Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.

🤗 Transformersは、テキスト・ビジョン・音声など複雑なモデル定義をサポートするフレームワークで、インフェレンスターやトレーニングに使用できる。

深層学習Transformer分類テキスト音声
用途
機械学習モデル定義
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

paperless-ngx — A community-supported supercharged document management system: scan, index and archive all your documents

paperless-ngxは、コミュニティによってサポートされたスーパーチャージドのドキュメント管理システムで、ドキュメントのスキャン・インデックス・アーカイブが可能である。

強化学習方策勾配 (PPO / A3C)分類テキスト
用途
ドキュメント管理
難易度
Easy
コスト
Low
githubGitHubあり2026-07-24

Medical_Image_Analysis — Foundation models based medical image analysis

医学画像分析は、医療の診断や治療を支援するために画像に記載されたデータから情報を抽出する研究分野です。この研究では、foundation modelsを用い、医療画像分析のための新しいアプローチを提案しました。found

自然言語処理大規模言語モデル生成画像テキスト
用途
医学画像分析
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

unsloth — Unsloth is a local UI for training and running Gemma 4, Qwen3.6, DeepSeek, Kimi, GLM and other models.

Unsloth Studioは、オープンモデルのトレーニングと実行を支援するWebUIです。このライブラリは、Gemma4、Qwen3.5などのオープンモデルのテストとトレーニングを支援するために使われます。

自然言語処理大規模言語モデルテキスト音声
用途
オープンモデルのトレーニングと実行
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

sglang — SGLang is a high-performance serving framework for large language models and multimodal models.

SGLangは、大規模言語モデルのサービングフレームワークです。このライブラリは、高性能なサービスフレームワークで、大規模言語モデルのサービングをサポートしています。

深層学習Transformer画像テキストマルチモーダル
用途
大規模言語モデルのサービングフレームワーク
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

ai-agent-book — 《深入理解 AI Agent:设计原理与工程实践》(李博杰 著)开源主仓库:全书正文、编译版 PDF 与按章配套代码

この論文では、現在のVision-Language-Benchmark(VLB)を超える、MLLMがアクティブな観察を実演できるようにするためのバenchmark、ActiveVisionを提案する。このActiveVi

自然言語処理大規模言語モデルテキストマルチモーダル
用途
弁論の実際的な対象を形成するためにAIが活用される
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

haystack — Open-source AI orchestration framework for building context-engineered, production-ready LLM applications. Design modular pipelines and agent workflows with explicit control over retrieval, routing, memory, and generation. Built for scalable agents, RAG, multimodal applications, semantic search, and conversational systems.

オープンソースのAIオーケストレーションフレームワークです。LLMアプリケーションの構築に必要なパイプラインやエージェントワークフローの設計ができるようになっています。

深層学習Transformer生成要約テキスト
用途
LLMアプリケーションの構築
難易度
Easy
コスト
High
githubGitHubあり2026-07-24

rasa — 💬 Open source machine learning framework to automate text- and voice-based conversations: NLU, dialogue management, connect to Slack, Facebook, and more - Create chatbots and voice assistants

rasaは、テキストやボイスベースの会話を自動化するオープンソースの機械学習フレームワークです。自然言語理解(NLU)、会話管理、 slackやFacebook等への接続など、幅広い機能を提供しています。

自然言語処理テキスト
用途
チャットボット作成
難易度
Easy
コスト
Medium
githubGitHubあり2026-07-24

presidio — An open-source framework for detecting, redacting, masking, and anonymizing sensitive data (PII) across text, images, and structured data. Supports NLP, pattern matching, and customizable pipelines.

presidioは、テキスト、画像、構造化データを含む敏感データを検出、削除、マスク、アノニマイズするオープンソースフレームワークです。自然言語処理、パターンマッチング、カスタマイズ可能なパイプラインをサポートします。

表形式向き深層学習Transformer分類検出画像
用途
データのプライバシーを保護する
難易度
Easy
コスト
Low
arxivPaper only2026-07-23

MIRROR: Learning from the Other View for Multi-Modal Reasoning

多モーダル理解技術のための新しいアプローチであるMIRROR(Learning from the Other View)を提案しました。MIRRORは、テキスト、図、テキストと図の組み合わせから同等の視点を提供することで

品質予測/異常検知自然言語処理大規模言語モデル画像テキストマルチモーダル
用途
多モーダル理解技術の開発
難易度
Hard
コスト
High
arxivPaper only2026-07-23

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

大規模な言語モデルを用いた推論技術のための新しいアプローチであるX$^3$-OPD(Distilling Reasoning into Large Audio-Language Models via On-Policy

センサ/時系列品質予測/異常検知深層学習軽量化・量子化テキスト音声マルチモーダル
用途
大規模な言語モデルを用いた推論技術の開発
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Climate-resilient electric vehicle charging infrastructure for sustainable cities: An interpretable causal-ensemble framework for preventive maintenance and low-carbon mobility

都市の電気自動車充電インフラは、可及的速やかに故障を予測・修理することで、耐久性と低炭素化を向上させる必要がある。機械学習を用い、故障を予測するモデルの開発を研究した。

説明可能センサ/時系列コンピュータビジョン動画認識予測テキスト
用途
都市の電気自動車充電インフラの耐久性向上
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Context-weighted Discrete Flow Matching

ディスクリートフロー・マッチングにおけるコンテキストの正しい有用性の利用を検討した。この研究では、ディスクリートフロー・マッチングのモデルの正確さを高めるためにコンテキストの有用性を適切に利用する方法を提案した。

品質予測/異常検知コンピュータビジョンセグメンテーション生成テキスト
用途
ディスクリートフロー・マッチングにおけるコンテキストの有用性
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Emergent Misalignment Recruits a Pre-existing Persona Subspace

アライメントした言語モデルの偏った表現の理解を進めた。この研究では、アライメントした言語モデルの表現を分析して、偏った表現を理解することができ、これを用いて、偏った表現を正すことができると主張した。

自然言語処理ファインチューニング生成テキスト
用途
アライメントした言語モデルの偏った表現の理解
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Demographically-Informed Heat-Mortality Risk Curves via Risk Graph Neural Networks

この研究では、リスクグラフニューリアルネットワーク(RGNN)を使用して、人口統計学的特性と地域の情報と組み合わせた熱死亡リスクを推定する新しい方法を提案し、DLNMの効果的な方法に代わる可能性があります。

説明可能センサ/時系列深層学習グラフニューラルネットテキスト時系列
用途
熱死亡リスクの推定
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

The Weight of Silence: A Causal Case for Weights Over the Scratchpad in Latent Chess Reasoning

ラテン言語モデルを使用すると、言語モデルの内部の計算結果を分析できる。計算結果は、連続ベクトル空間として実行される中間計算であり、これを分析すると、モデルがどのように結果を得ているかを明らかにできる。

MI向き自然言語処理ファインチューニングテキスト強化学習
用途
ラテン言語モデルの中間計算を分析する
難易度
Hard
コスト
High
arxivPaper only2026-07-23

GraphVid: Interactive Graph-Controllable Video Generation

GraphVidは、グラフと文本から生成することができ、オブジェクトの複数の移動を正確に制御することができる。グラフではオブジェクトの動きを表す情報を保存し、文から生成の制約を指定することができる。

品質予測/異常検知生成AI動画生成生成画像テキスト
用途
コントロール可能なビデオ生成
難易度
Hard
コスト
High
arxivPaper only2026-07-23

From Resource Flow to Executable Tests: Petri-Net-Guided LLM Test Generation for Concurrent Stateful Rust APIs

この研究は、リソースフローの動作を表すPetriネットと、APIを操作するためのテストを自動生成する方法を提案した。方法は、APIの機能をテストするためのシナリオを生成し、テストが正しく実行されるようにした。

自然言語処理大規模言語モデル生成テキスト
用途
共時進行のコンカURRENCYAPIのテスト
難易度
Hard
コスト
High
arxivPaper only2026-07-23

ElasticTTT: Prior-Preserving Test-Time Tuning for Video Editing

ElasticTTTは、プログラムがテストのときに動作を調整できるようにした。方法は、テストのときにモデルが前のサンプルの情報と現在の情報を組み合わせて、ビデオを編集する際に正しく動作するようにした。

生成AI拡散モデル生成テキスト動画
用途
ビデオ編集時のテスト タイムチューニング
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Artificial Epanorthosis: Why large language models overuse a classical rhetorical figure, and how to mitigate it

Artificial Epanorthosisは、大規模言語モデルが古典的なルレチックの表現を使用する傾向に注目した。結果は、モデルのトレーニングデータの形状がこの傾向に影響していることができた。

深層学習軽量化・量子化分類生成テキスト
用途
大規模言語モデル上のエパノルシス
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Safeguards for Speech2Speech LLM-Assistants: A Case Study in Automotive Applications

S2S (Speech-to-Speech) LLMアシスタントを利用して、人間のような話し方をすることができますが、安全対策の実装が困難です。この研究では、S2S LLMアシスタントの安全対策を2つのアプローチで実現し

自然言語処理大規模言語モデルテキスト音声
用途
S2S LLMアシスタントの安全対策
難易度
Hard
コスト
High
arxivPaper only2026-07-23

V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure

ビデオLMMの安全性を確認するために、新しい診断フレームワークを提案します。これらのフレームワークは、モデルの挙動、理解、セマンティクスを同時に考慮します。

自然言語処理大規模言語モデル画像テキスト動画
用途
ビデオ安全性デ-カリブレーションの診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Beyond Independent Optimization: Compression, MoE Routing, and Quantization Interactions in Multimodal Edge Intelligence

効率的な多モードの推論は、モデルの性能やFLOPCOuntだけでなく、移動、キャッシュ、変形、量化された表現を保存するコストやメモリ、エネルギーに関する制約にも制限されています。この論文では、最近のビジュアルトークン圧縮

品質予測/異常検知深層学習Transformer画像テキスト動画
用途
分析的コストと効率性を向上させるための多モードのエッジAIの効率化
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Surprisal Theory is Tautological (without Rational Grounding)

ある単位の人間の認知的難易度は、その単位のスルーパイズアル (Surprisal) と特定の言語モデルによれば線形関数に等しいという理論が存在します。しかし、この理論は実態を反映していないという批判があります。この論文で

自然言語処理テキスト
用途
認知的難易度と言語モデルとの関係
難易度
Hard
コスト
High
arxivPaper only2026-07-23

MedGame: Storytelling Gamification Empowered by Large Language Models for Medical Education

Large Language Models (LLMs) は医学教育に大きな可能性を持っていますが、現在のシステムでは、質問に答えるか一時的なフィードバックしか行なわれていません。一方、臨床病例を決定センターへの学習トレ

自然言語処理大規模言語モデル生成QAテキスト
用途
医学教育への Large Language ModeL の適用
難易度
Hard
コスト
High
arxivPaper only2026-07-23

DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages

この論文では、DONDO と呼ばれるアフリカ諸国向けの音声認識ベースモデル (ASR)が構築されました。これらのモデルは、自律学習型スピーチエンコーダーであるw2v-BERT 2.0を使用して構築されています。このエンコ

センサ/時系列深層学習Transformer分類テキスト音声
用途
アフリカ諸国への音声認識技術の適用
難易度
Hard
コスト
Low
arxivPaper only2026-07-23

When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs

この論文では、大規模言語モデル (LLMs) が日常的な文化的知識を評価する能力に着目しています。ここで、TriviaRoomQA というクイズスタイルで問題を提示して、LLMs が日常的な文化的知識をどのように評価する

自然言語処理大規模言語モデルテキスト
用途
大規模言語モデルにおける日常生活の知識の評価
難易度
Hard
コスト
High
arxivPaper only2026-07-23

An Evaluation Framework for Structured Audio Captions Validated by Controlled Perturbations

この論文では、音声字幕の評価手法が提案され、音声字幕の評価において既存の手法の制約を克服することを目指しました。提案されたフレームワークは音声字幕の各側面を評価し、質問回答型の評価手法ではなく字幕の中立性を評価することが

センサ/時系列自然言語処理大規模言語モデル生成テキスト音声
用途
音声字幕の評価フレームワークの構築
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Anti-Periodic Positional Encoding: Möbius Boundary Conditions Make In-Context Retrieval Reliable

この論文では、対称的な位置エンコードにモビアスの対称性を適用しました。これにより、ローテーションの平面での各位置間のホロノミーが -1 となり、シーケンスの両端が決定的に結合されます。この手法により、精度が高額になること

自然言語処理プロンプトエンジニアリングテキスト
用途
モビアスの対称性に基づく対称的な位置エンコード
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning

長形推論のための言語モデルが、提供されたコンテキストから乖離した論理を生成する可能性があることを指摘し、コンテキストと推論論理をより適切に融合するため、 REFACT (REstating Facts in Adapti

自然言語処理大規模言語モデル生成テキスト
用途
Chain-Of-Thought (CoT) の改善
難易度
Hard
コスト
High
arxivGitHubあり2026-07-23

Inference-Time Scaling of Diffusion Models via Progressive Seed Pruning

ディフュージョンモデルにおける初期的なNoise Seed の影響が、モデルが生成する高質のイメージに大きく影響していることを提示し、Seed Search 時の時間的負荷を削減するための方法を提案した。

品質予測/異常検知深層学習軽量化・量子化生成画像テキスト
用途
ディフュージョンモデルのサケリング
難易度
Hard
コスト
High
arxivPaper only2026-07-23

SPDCN: Strip-based Deformable Convolutional Network for Steel Surface Defect Segmentation

ステンレス鋼の表面欠陥検出は、工業的な品質検査において重要であるが、従来の方法は、ひずみ、非対称性や欠陥の境界の不規則性に伴う標準的な共通化の非対称受容領域と剛性のサンプリンググリッドを利用しているため、ひずみ、非対称性

品質予測/異常検知画像検査深層学習Transformerセグメンテーションテキスト
用途
ステンレス鋼表面損傷の検出
難易度
Hard
コスト
Medium
arxivPaper only2026-07-23

Towards Privacy-Preserving Federated Prompt Tuning under Data Heterogeneity: A Subspace-Decomposed Expert Approach

Federated プールトーニングは、視覚言語モデルを軽量なプールで共有することで、視覚的、言語的、音声的なモデルを組み込んだ視覚言語モデル(VLM)の共有の協力的適応を実現する。従来のプールを使用する方法では、個々の

MI向き深層学習軽量化・量子化テキスト
用途
対称性を持つ視覚言語モデルでのプールトーニング
難易度
Hard
コスト
Medium
arxivPaper only2026-07-23

HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models

大規模言語モデルはさまざまな画像をテキストに変換する上で優れた性能を示しているが、発生するホログラフィックな診断にはまだ解決策が必要です。この研究では、主流の粗い検出方法の欠点を補うため、細部の診断方法を提案しています。

説明可能自然言語処理大規模言語モデル分類検出生成
用途
ホログラフィックハロウィーンの診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Loss Landscape Topology Reveals Why Simple Baselines are Competitive at 3D Point Cloud Segmentation Under Class Imbalance

3D点群のセグメンテーションではクラス不均衡が発生し、有効な解決策が必要です。この研究では、11 つの不均衡対策を 2D のコンピュータビジョンとは異なる 3D の上で評価し、標準的な交差エントロピーと均衡の重み付けが競

コンピュータビジョンセグメンテーションテキスト3D
用途
3D点群のセグメンテーション
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

大規模言語モデルのハロウィーン診断では、対象の 3D 空間関係を推論する際に、視覚化が欠如していることが問題となります。この研究では、これらのハロウィーンを軽減するためのアプローチを提案しています。

自然言語処理大規模言語モデル画像テキスト3D
用途
3D空間推論のハロウィーン診断
難易度
Hard
コスト
High
arxivPaper only2026-07-23

C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs

大規模言語モデルの圧縮には、モデルのパフォーマンスが低下する可能性があるため、量化の保護が重要です。この研究では、Fisher加重チャネル感受性を用い、MLLMの量化を安定させるためのC-PTQをプロPOSEしています。

深層学習Transformerテキストマルチモーダル
用途
大規模言語モデル圧縮
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

空間理解は、物理世界と静的のセマンティック理解の間でつながるために不可欠です。多くの空間タスクは、場所、領域、パスの自然な表現は、ポインティングやマーキングなど、連続的な視覚的シーンで行われることが多いが、現行の空間推論

自然言語処理大規模言語モデル生成画像テキスト
用途
空間理解
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Do Pathology Vision-Language Models Truly See Pathology?

パスロジは、現在、パスロジ認識のための画像言語モデルを評価するために広く使用されていますが、この研究では、パスロジ認識において画像言語モデルの視覚知覚が機能していることを疑問に問っています。

自然言語処理大規模言語モデル画像テキストマルチモーダル
用途
パスロジの認識
難易度
Hard
コスト
High
arxivPaper only2026-07-23

Sidewalk Moments: Are Richer Representations Always More Human-Aligned? Evidence from City-Walk Videos

この研究では、都市ウォークビデオを分析するために、4つのモダリティの表現(スペース時領域情報、時間平均画像、オーディオ符号化、テキストベースの表現)を使用しました。

MI向き品質予測/異常検知深層学習Transformer分類画像テキスト
用途
都市ウォークビデオの分析
難易度
Hard
コスト
High
arxivPaper only2026-07-23

FORGE-plus: Force-Budgeted Recovery for Contact-Rich Assembly with a Frozen LLM Supervisor

強制制約に基づく強化学習を利用し、低コストで高精度の組み立てが可能になると同時に、組み立てに失敗してもロボットが安全に回避できるように、ロボットの制御のための強化学習を提案します。

自然言語処理大規模言語モデルテキスト強化学習
用途
非対称ロボット組み立て
難易度
Hard
コスト
High
arxivPaper only2026-07-23

ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments

オブジェクト目標のナビゲーションにおける、動的な避け方とマルチフロア環境を考慮した、ゼロショットオブジェクトナビゲーションのフレームワークを提案します。このフレームワークでは、動的な人々とマルチフロア環境を考慮しながら、

自然言語処理ファインチューニングテキスト3Dマルチモーダル
用途
マルチフロアにおけるオブジェクト目標のナビゲーション
難易度
Hard
コスト
High
arxivPaper only2026-07-23

TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation

オートメーションされたマニピュレーションを目的とした、大規模なテーブルトップのデータセットであるTableVerse を提案します。このデータセットには、物理的に可能な実世界のレイアウトを生成する実用的な方法が含まれてお

品質予測/異常検知自然言語処理RAG生成画像テキスト
用途
オートメーションされたマニピュレーションのためのテーブル環境の生成
難易度
Hard
コスト
Low
githubGitHubあり2026-07-23

Causal-Forcing — [ICML 2026] Official codebase for "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation" & Causal Forcing++

この論文では、Causal-Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive

品質予測/異常検知深層学習軽量化・量子化生成テキスト動画
用途
高品質のビデオ生成を実現する。
難易度
Easy
コスト
High
githubGitHubあり2026-07-23

unstructured — Convert documents to structured data effortlessly. Unstructured is open-source ETL solution for transforming complex documents into clean, structured formats for language models. Visit our website to learn more about our enterprise grade Platform product for production grade workflows, partitioning, enrichments, chunking and embedding.

ドキュメントを構造化するために使えるオープンソースのETLソリューション。

表形式向き自然言語処理大規模言語モデル画像テキスト表形式
用途
ドキュメントの構造化
難易度
Easy
コスト
High
arxivPaper only2026-07-22

Evaluating and Mitigating Gender Bias in Pre-trained Embeddings for ML-based Recruitment

この研究では、AIベースの採用システムを使用して、過去の履歴データに基づいて機械学習モデルをトレーニングすることで、社会的偏見を永続させたり強化したりするリスクを評価および緩和することを目的とした。

自然言語処理埋め込み・検索テキスト
用途
人才採用における偏差解消
難易度
Hard
コスト
Low
arxivGitHubあり2026-07-22

Antigen-specific Antibody Multi-modal Foundation Model for Functional Antibody Design

この研究では、抗原特異性抗体を設計するために、抗原および抗体の間でエピトープレベルでのペアリングが必要であることを考慮した、抗原特異性の抗体多モーダルファンデーションモデル(AAMFM)を提案しました。

自然言語処理RAG分類生成テキスト
用途
抗原特異性抗体設計
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Hypothesis-and-Refinement Learning of Organic Structures from Multimodal Spectroscopic Data

分子構造を決定するために、スペクトルデータから自動的な構造解析を実施するための方法を提案している。この方法は、スペクトルデータに基づいてヒントと改良を繰り返すことで、分子構造を決定するもので、分子の可能性の広範な構造スペ

MI向き自然言語処理ファインチューニング生成テキストマルチモーダル
用途
分子構造の解析
難易度
Hard
コスト
High
arxivPaper only2026-07-22

OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization

大規模言語モデルを制御するために活性化制御を使用するときに生じる可能性のある外部性、つまり安全性を低下させる可能性と、禁止された要素を誘発する可能性を軽減するために、制御ベクトルの洗浄を実施する提案されている。

深層学習軽量化・量子化テキスト
用途
適応制御
難易度
Hard
コスト
High
arxivPaper only2026-07-22

TriAgent: Divergence-Aware Multi-Agent Committees for Cost-Efficient Financial Sentiment Analysis

生産的言語モデルの利用による金銭的感情分析に対処するための方法を提案している。複数のエージェントを活用したコミティー方式を使用し、さまざまな粒度のテキストデータに対応できるように、単語レベルのルールベースアプローチ、句節

深層学習Transformer検出テキスト
用途
金融分野の感情分析
難易度
Hard
コスト
High
arxivPaper only2026-07-22

An Isotropy-Preserving Spectral Cap for Muon: Theory and Three Case Studies

language モデルを前訓練するために、Muon などの矩式最適化を使用するが、これらのモデルの内部幾何学を保持する方法についてはよくわかっていない。仮定から、モデルの内部幾何学を安定化するために、SGDに内在するb

深層学習正規化・最適化手法テキスト
用途
モデルの内部幾何学の安定化
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Multi-Mask Diffusion Language Models for Few-Step Generation

この研究では、多マスク分散言語モデルを提案します。このモデルには、複数のマスクがあり、それぞれが異なる生成タスクを実行することになります。このモデルは、生成タスクの多様性を高めることができ、生成された文がより多様性の高い

品質予測/異常検知深層学習軽量化・量子化生成テキスト
用途
リトルバイトの生成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Nuclear Quantum Effects as a Denoising Problem

この研究では、核量子効果をシミュレートするために、画像時刻パス積分を利用した分散機械学習アルゴリズムを提案します。このアルゴリズムは、分散機械学習を利用して核量子効果をシミュレートすることに成功し、核量子効果に関連する問

MI向きコンピュータビジョンセグメンテーション生成テキスト
用途
核量子効果のシミュレーション
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PoTRE: Test-Time Reasoning inspired by Cognitive Heterogeneity

モデルの脆弱性を解決するために、四つのエージェントに分割される多様なフレームワークPoTREを導入した。モデルの推論能力を強化し、単一のストリーミングアプローチよりも複雑な理論的制約とアブストラクションに抵抗できるように

表形式向き自然言語処理大規模言語モデル生成テキスト
用途
複雑な推論力のあるタスクの解決
難易度
Hard
コスト
High
arxivPaper only2026-07-22

The Maskability Index: Predicting Task-Objective Alignment in Pretrained Language Models

ある知識関係がマスクスタイルのパラミトリックパラメータ化方法で適切かどうかを計算したメトリックとしてMaskability Index (MI)を導入した。DepthRankの違いを用いて、与えられたパラメータ化方法で知

少数データ向き深層学習Transformer生成テキスト
用途
強い知識獲得タスクでのパフォーマンスの向上
難易度
Hard
コスト
High
arxivPaper only2026-07-22

The Ethics of Autonomous AI Agents for Offensive Security

侵攻テストツールが異なっている点、決定主義的な性質、狭く特定されたスコープ、専門技術の操作を用いたものと異なり、LLM駆動の自治的セキュリティツールは3つの次元で不確実性を示した。政策決定への説明が困難、影響の開放性、行

自然言語処理大規模言語モデルテキスト
用途
自律的セキュリティツールの倫理的考慮
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

3つのタスクをサポートする音曲生成フレームワークを提示した。これらのタスクには、歌詞、テキストの説明、音楽的特性を利用して、歌詞の生成、バンドの音楽の生成、カバー曲の生成などが含まれる。

品質予測/異常検知深層学習軽量化・量子化生成テキスト音声
用途
音楽の生成
難易度
Hard
コスト
High
arxivPaper only2026-07-22

On the Systematic Challenges of Culturally Loaded Machine Translation: Dream of the Red Chamber as the Cultural Lens

文化的意味の表現が表現された翻訳には、翻訳システムが表現する意味を理解するために、表現の文化的背景を考慮する必要があることを指摘した。文化的背景が表現されている表現された翻訳には、いくつかの課題があり、LLMベースの翻訳

品質予測/異常検知自然言語処理大規模言語モデル翻訳テキスト
用途
文化的意味の表現
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Small, Free, and Effective: Orchestrating Open-Weight Small Language Models to Outperform Single LLM for Malware Analysis

分析報告の迅速な解釈が求められるときに行われるマルウェア分析を実現するために、閉じた重みの大きい言語モデルを使用しないことが多い。オープン重みの言語モデルは、マルウェア分析のために適切な言語能力と、閉じた重みの大きい言語

自然言語処理大規模言語モデルテキスト
用途
マルウェア分析のための小規模な言語モデル
難易度
Hard
コスト
High
arxivPaper only2026-07-22

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

危険な問題に対する正しい答えを提供する大きな言語モデルと費用の効率が良い、小さな言語モデルを協力させる技術が開発されました。

深層学習軽量化・量子化生成テキスト
用途
小さな言語モデルを大きい言語モデルと協力させる手法が効率的かつ安全に実装される
難易度
Hard
コスト
High
arxivPaper only2026-07-22

HalluTruthQA: A Fine-Grained Benchmark for Hallucination Detection, Localization, and Explanation in Arabic Question Answering

大きな言語モデルは真実の情報を提供できるように見えますが、実際は虚偽情報を提供することが多く、これを検知、検出、および検証するための基準を作成するため、HalluTruthQAが開発されました。

自然言語処理大規模言語モデル検出QAテキスト
用途
仮想の答えを検知、検出、および検証するための基準を作成する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

RALS: Resources and Baselines for Romanian Automatic Lexical Simplification

文語の簡素化は、言語学習者の理解を促進するための有効な手法ですが、現在実際に有効であるかどうかが確立されていません。ルーマニア語で文語の簡素化に関する基準とリソースが作成されました。

コンピュータビジョンセグメンテーションテキスト
用途
文語の簡素化のためのルーマニア語のリソースと基準
難易度
Hard
コスト
Medium
arxivPaper only2026-07-22

TINY_SCHILLER: A Drop-In German Drama Corpus for Small Language Models

小さな言語モデルに対するドロップインコーパス、tiny_schillerを導入し、単一ファイルで利用できるようにし、言語モデルを簡単にprototyping、fine-tuning、教育、研究に利用できるようにする。

自然言語処理大規模言語モデルテキスト
用途
ナイーブな言語モデルに対するドロップインコーパスの提供
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

3D オキュピエンシー予測には、物体の配置と密度を解釈するための視覚的手法が必要です。従来の方法では、計算コストが高くなりすぎていたが、新しく提案されたGaussianSeedアルゴリズムは、層を階層化することで、計算コ

品質予測/異常検知自然言語処理大規模言語モデル生成テキスト
用途
3次元空間における物体の配置と密度の予測
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Lightweight Person-Place Relation Extraction from Historical Newspapers with Dependency Graphs and Proximity Features

人名と場所の関係を抽出するタスクは、歴史的ニュース記事の解釈において重要です。従来の方法では、言語モデルの前処理が必要でしたが、Lightweightアルゴリズムは、依存グラフと近接特性を使って、歴史的ニュース記事から人

説明可能CPUで試しやすい深層学習軽量化・量子化分類テキスト音声
用途
歴史新聞から人名と場所の関係の抽出
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Reference-Free Evaluation of Reasoning in Open-Ended Question Answering

この研究では、AI生成物の論理的評価に必要なものとして、生成物がどうやって結果を得るのかを明らかにすることの重要性を強調しています。この研究では生成物を分解し、その論理的な構造を理解するために自然言語推論を利用し、生成物

自然言語処理大規模言語モデルQAテキスト
用途
AI生成物の論理的評価
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Self Gradient Forcing: Native Long Video Extrapolation

長時間ビデオエクストラポレーションには、高度な視覚的知能が必要です。Self Gradient Forcingアルゴリズムは、学生モデルを教師モデルから生成される歴史の下で学習させることで、長時間ビデオエクストラポレーシ

コンピュータビジョンセグメンテーション生成テキスト動画
用途
長時間ビデオエクストラポレーションのための自力勾配強制
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

多モーダルラージランゲージモデルは、視覚言語タスクに強いですが、高い推論コストで問題となっています。Look Less, Think Fasterアルゴリズムは、単位次元を個別に最適化することで、多モーダルラージランゲー

深層学習軽量化・量子化画像テキストマルチモーダル
用途
多モーダルラージランゲージモデルによる視覚言語タスクでのコスト削減
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?

画像理解のための多モーダルラージランゲージモデルは、強力ですが、まだ能力と限界については明確な理解が不足しています。この論文では、多モーダルラージランゲージモデルが画像理解においてどの程度の能力と限界を持つか、を分析し、

センサ/時系列深層学習軽量化・量子化QA画像テキスト
用途
画像理解における多モーダルラージランゲージモデルの能力と限界
難易度
Hard
コスト
High
arxivPaper only2026-07-22

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching

ステレオマッチングは3次元再構成において重要なタスクです。この研究では、ステレオマッチングを確率的生成タスクと組み合わせ、オブジェクト検出の向上を目的として、ステレオマッチングフレームワークと潜在分配を統合する方法を提案

深層学習Transformer生成回帰画像
用途
オブジェクト検出の向上
難易度
Hard
コスト
High
arxivPaper only2026-07-22

OffNadirLoc: Benchmark and Framework for Challenging UAV-to-Satellite Geo-Localization under Large Off-Nadir Views

OffNadirLocは交差視点地理位置を推定するための基準セットを提案します。これにより、ドローンと衛星画像の交差視点地理位置推定プロセスでは重要な構造的シーン理解と内部ドメイン間の関係制約に焦点を当てることができます

自然言語処理プロンプトエンジニアリング検出画像テキスト
用途
ユーザー間の地理的位置の推定改善
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos

この研究では、ドローンで小さな物体を認識することを目的としたメモリ拡張型大規模言語モデルを開発しました。このモデルは、複雑なドローンの場面で、ユーザーの指示に従って物体を識別できるようになります。

自然言語処理大規模言語モデルセグメンテーション画像テキスト
用途
ドローンで物体認識を実行する
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

自動運転システムには、道路のトポロジー(ドライバブルレーンとその接続性)を理解する機能が必要です。最近の検出モデルは360度の前方視野からボリュームイメージを取得することで、道路上のレーンのトポロジーを推測することができ

自然言語処理RAG画像テキストマルチモーダル
用途
道路のトポロジー認識を改善
難易度
Hard
コスト
High
arxivPaper only2026-07-22

Physics-Aware Complex-Valued State Space Model with Scattering-Prior Feature Modulation for PolSAR Image Classification

この研究では、地象性AIにおける物理的知識を使用してポーラリメトリック合成開口ラダール画像を分類するための新しいモデルを提案しました。このモデルは、ラダール画像を物理的なプロセスと関連付けることができます。

深層学習軽量化・量子化分類埋め込み画像
用途
ポーラリメトリック合成開口ラダール画像の分類
難易度
Hard
コスト
Low
arxivPaper only2026-07-22

Look Before You Edit: Attention-Guided Camera Placement and Multi-View Alignment for 3D Gaussian Splatting Editing

DRGBTトラッキングの分野では、目標物を変動するセンシングモデリティと観測プラットフォームの条件下で追跡することが求められます。ドリフト、視線、時間の条件変化に関しても検討が必要です。ただし、現在のバenchmarkで

深層学習Transformerテキスト3D
用途
DRGBTトラッキングを改善
難易度
Hard
コスト
High
arxivPaper only2026-07-22

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

Language-Guided Grasping は、複雑なシーンで物体の把持を行うために、視覚言語モデル(VLM)を用いる。このアプローチでは、VLM は直接把持を予測するのではなく、3 次元空間における把持の位置を指

深層学習軽量化・量子化生成テキスト3D
用途
複雑なシーンで物体の把持を実現
難易度
Hard
コスト
High
arxivGitHubあり2026-07-22

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

ReferTrack は、自然言語で対象の車両に付近する自動車を追従させるシステムである。このシステムでは、対象の車両に付近する自動車を認識する後、自動車の動きを予測する。

自然言語処理プロンプトエンジニアリング検出画像テキスト
用途
自動車が対象の車両に付きそわせるシステム
難易度
Hard
コスト
High
arxivPaper only2026-07-22

SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation

SOPD-SocialNav は、学習モデルを小さなロボットに伝える技術であり、ロボットが環境と人間の行動を理解し、ナビゲーションが行えるようにする。

深層学習軽量化・量子化テキストマルチモーダル
用途
ソーシャルなナビゲーションのための学習モデルを小さなロボットに伝える技術
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Boundary-Adapted PINNs for Elliptic Dirichlet Problems: $H^2(Ω)$ A Priori Error Bounds with Application to Mean Escape Time Computation

この研究では、Oceanモデルを使用して、オーシャンで不完全な観測を使用する可能性と、生成的ステートスペースモデルと最適化フレームワークを使用して直接不完全な観測から学習する能力を評価します。

強化学習方策勾配 (PPO / A3C)テキスト
用途
Oceanモデルにおける不完全な観測の使用
難易度
Hard
コスト
Medium
arxivPaper only2026-07-21

Agents in the Wild: Where Research Meets Deployment

分散型言語モデル(LLM)やコンテキストを活用するエージェントは、製品開発やファイナンス分野で活用されている。エージェントを実用化するには、堅牢性、安全性、信頼性を確保することが大切となる。 このチュートリアルでは、エー

自然言語処理大規模言語モデルテキスト
用途
エージェントの実践
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Selection Shapes the Boundary: A Preregistered Replication of Monotonicity and Label Agreement in Unselected NLI Populations

人間が与えるラベル相違を研究した研究では、主に分異議のあるデータを選んで分析したところ、非上昇漸近性オペレータを持つ仮説がChaosNLIで低いラベル相互に関連性があると結論づけた。しかしながら、データが選択されていない

品質予測/異常検知コンピュータビジョンセグメンテーション分類テキスト
用途
NLIデータのラベル相違の境界の検証
難易度
Hard
コスト
Low
arxivPaper only2026-07-21

The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation

この研究では、学生チームのテーブル演習(TTX)における評価方法を提案し、複雑でオープンエンドな状況にあるチームの行動とコミュニケーションを記録できるTTX学習プラットフォームを使用します。

品質予測/異常検知自然言語処理大規模言語モデル翻訳テキスト強化学習
用途
計算機教育のチーム問題解決能力評価
難易度
Hard
コスト
High
arxivGitHubあり2026-07-21

Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning

この研究では、平衡方程式を満たすPINNs(物理基準付きニューラルネットワーク)を使用して、平均脱出時間の計算を目的とした椭球型境界条件付きPINNsを提案し、PINNsを使用した計算と実験室データを比較します。

品質予測/異常検知自然言語処理ファインチューニング翻訳テキスト強化学習
用途
平均脱出時間計算を目的とした椭円型境界条件付きPINNs
難易度
Hard
コスト
High
arxivPaper only2026-07-21

DAIS: Dependency-Aware Intermediate QA Supervision for Complex Reasoning

この研究では、Chain-of-Thought (CoT) スーパーヒバテーションでは、最終的な答えに到達するまでの理由を公開することで、中間的には提供される理由の質を強力にし、しかし、多くの場合には、前のステージに到達

深層学習軽量化・量子化テキスト
用途
QAにおけるメモリ補助システムの開発
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

ある単語を複数のスピーカーや環境の異なる条件下で言語モデルが使用できるようにしたい場合は、単語の抽出を実現する必要がある。しかし、現在の言語モデルでは、スピーカーの特性や環境の特性が単語に含まれていることが多い。ここでは

センサ/時系列深層学習Transformerテキスト音声教師あり
用途
可変な条件における単語の抽出
難易度
Hard
コスト
Medium
arxivPaper only2026-07-21

Verifiable Self-Evolution for Open-Ended Dialogue Skills via Future-Feedback Prediction

この研究では、固定化された言語モデルを強化するために、自律進化する対話スキルを開発しています。このシナリオでは、ユーザーの反応がモデルの進化に影響を受けないため、対話の対称性を維持する必要があります。

説明可能品質予測/異常検知深層学習軽量化・量子化テキスト
用途
对話スキル自律進化
難易度
Hard
コスト
Medium
arxivPaper only2026-07-21

Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM

人間は、大きな言語モデルを使って長い論理的推論を行うが、このような推論の結果は正しくない可能性がある。ここでは、これらの発言を検証する手法を提唱する。

自然言語処理大規模言語モデルテキスト
用途
大型言語モデルの中での論理的推論を検証する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

HindsightBench: A Black-Box Behavioral Audit Protocol for Parametric Hindsight in Time-Indexed LLM Decision Tasks

大規模言語モデルは、決定タスクを遂行する過程で、実行された事実を含むパラメトリックな知識を漏らす傾向にある。大規模言語モデルが実際にどのような意思決定タスクを遂行したかを検証するのは困難であるものの、これが確かに事実であ

深層学習軽量化・量子化生成テキスト
用途
LLMによる金融意思決定タスクの検証
難易度
Hard
コスト
High
arxivPaper only2026-07-21

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

無線無人飛行機のルートプランニングでは、視空間と言語モデルを利用して安全なルートを生成する必要がある。この問題を解決するために、テスト時にモデルをスケールアップさせる方法を提案する。

コンピュータビジョンマルチモーダルテキスト
用途
無線無人飛行機のルートプランニングを改善する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Anatomy-Aware 3D Mesh Refinement of Pericardium Segmentations on Computed Tomography

心臓の囲みの区別は、食道肥厚の測定に重要であるが、しかし、これを正確に区別することは難しい。これを解決するために、周囲の解剖学的構造を利用して囲みの区別を改善する方法を提案する。

自然言語処理RAGセグメンテーション画像テキスト
用途
心臓CT画像から心臓の囲みを正確に区別する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency

自動運転のための計画とは、状況理解、タイムリーな推論、行動選択というものがあるが、しかし、これらの要素を組み合わせるのは難しい。これを解決するために、シーン理解を分離することによって、計画を安全かつ有効性のあるものにする

深層学習軽量化・量子化画像テキストマルチモーダル
用途
自動運転のための分離された計画システムを提案する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory

World Action Models(WAMs)は、ロボットマニピュレーションをモデル化するパラダイム。WAMsは、視覚ステートトランジションとロボットアクションを同時にモデル化する。しかし、既存のWAMsは、一定の時

自然言語処理プロンプトエンジニアリング画像テキスト動画
用途
多目的マニピュレーション問題を解決する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Beyond Transformers: Linear Attention Policy for Open-Vocabulary Object Goal Navigation

オープン・バグナビゲーションには、エージェントへの部分観測が含まれます。パフォーマンスの向上のために、内部状態更新が重要です。これを実現するには、ポリシーネットワークの更新が必要です。最近のアプローチでは、トランスフォー

深層学習Transformerテキスト3D
用途
オープン・バグナビゲーション問題を解決する
難易度
Hard
コスト
High
arxivPaper only2026-07-21

Motion Primitive Discovery in a Humanoid Robot via Self-Organising Maps for Phase Recognition

行動モーター特徴は、社会認知や人間ロボットインターフェースなどの行動認識の核心です。人間ロボットのNICO用に、2段階のアーキテクチャを提案します。1段階目では、腕の移動を学習するSOMと、手の移動を学習するSOMを使用

コンピュータビジョン動画認識分類テキスト動画
用途
マニピュレーターの動作モーター特徴を解決する
難易度
Hard
コスト
High
arxivPaper only2026-07-20

O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

工場の中の異常が検出されるように設計された機械学習モデルを提案しています。通常の方法では、モデルはビデオ内のすべての内容を考慮し、複雑な問題を解決することは困難です。提案されたモデルのアプローチは、オブジェクトを検出して

説明可能品質予測/異常検知自然言語処理ファインチューニング検出異常検知テキスト
用途
産業ビデオの異常発生検出
難易度
Hard
コスト
High
arxivPaper only2026-07-20

LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

この研究では、ルビック評価を含む非確認タスクの最適化を目的とします。従来のRLには、モデル評価の情報が使われるだけですが、モデル自身は反省や自己改善はすることがありません。ここでは、LJMをコーチとみなして、モデルが反省

品質予測/異常検知深層学習軽量化・量子化テキスト強化学習
用途
ルビック評価を含む非確認タスクの最適化
難易度
Hard
コスト
High
arxivPaper only2026-07-20

FinSAgent: Corpus-Aligned Multi-Agent RAG Framework for Evidence-Grounded SEC Filing Question Answering

金融質問回答を実行するには、長い標準化されて高度に冗長な説明書に分散する証券取引委員会(SEC)の証拠を取得する必要がある。既存の取得を拡張するおよび多要素システムの多くの選択肢は、モデルの先行事項と目的のファイルリング

深層学習軽量化・量子化生成QAテキスト
用途
金融質問回答問題を解決
難易度
Hard
コスト
Low
arxivPaper only2026-07-20

VDAR-Router: Adaptive LLMs Routing via Verbalized Query Difficulty Analysis Retrieval

大きな言語モデルは実用システムで増えているため、費用対効果のあるモデルを選択することが重要になる。モデルを割り当てるためにLKM路線が提案された。しかし、既存の路線方法は入力問に基づいてモデルを選択し、モデルに適合しない

深層学習軽量化・量子化テキスト
用途
model routingの問題を解決
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models

この研究では、混乱のないターゲットに可視化言語アクションモデルを適応させることを目的として、3つのモデルを使用して研究を行った。3つのモデルは、観察から直接行動へのマッピング、テキストチャインオブスロット、潜在的な反復ル

自然言語処理RAGテキストマルチモーダル
用途
可視化言語アクションモデルを混乱のないターゲットに適応させる
難易度
Hard
コスト
High
arxivPaper only2026-07-16

GAttNHP: Group Attention Neural Hawkes Process for Extrapolation Reasoning in Temporal Knowledge Graphs

この研究では、時系列データの予測を目的に、新しいフレームワークを提案しました。このフレームワークは、時系列データの予測を容易にするために、グループの注意とニューハウクスプロセスを組み込んでいます。

深層学習Transformer回帰予測テキスト
用途
時系列データの予測
難易度
Hard
コスト
Low
arxivPaper only2026-07-16

Precise sample covariance spectral norm error -- an RDT view

この研究では、サンプル協方差行列の精度を向上させる方法を検討しました。特に、サンプルサイズが小さく、収集されたデータの特性から、正解率の期待値は小さい場合に、問題が最も発生しやすくなる可能性があります。この研究では、正解

コンピュータビジョンセグメンテーションテキスト
用途
サンプル协方差行列の精度を向上させる
難易度
Hard
コスト
Medium
arxivPaper only2026-07-15

Operator-Informed Gaussian Processes for Complex Helmholtz Wavefields: From Synthetic Benchmarks to In Vivo Brain Elastography

Helmholtz方程式は、時間共伴振波の伝播を記述する重要な方程式であり、媒質が損失した場合複素係数を持ちます。ここでは、空間での波場から波方程式を推測するために、物理知識に基づくGaussian Process(GP

少数データ向き強化学習マルチエージェント回帰テキスト
用途
复雑なHelmholtz波場のための物理知識に基づくGaussian Process
難易度
Hard
コスト
Medium
arxivPaper only2026-07-15

Price of Fairness in Bandits: A Tight Minimax Characterization

最小限マージン定理を仮想環境における公平性と利益のトレードオフの分析に導入します。この定理により、公平性と利益のトレードオフを最小限の公平性確保することで解決することができます。

自然言語処理ファインチューニングテキスト
用途
仮想環境における公平性と利益のトレードオフを分析するための最小限マージン定理の導入
難易度
Hard
コスト
Medium
githubGitHubあり2026-07-15

vowpal_wabbit — Vowpal Wabbit is a machine learning system which pushes the frontier of machine learning with techniques such as online, hashing, allreduce, reductions, learning2search, active, and interactive learning.

Vowpal Wabbitは、機械学習を進歩させるためのオンライン学習、ハッシュ、reduceなどの強力なアルゴリズムを含むシステムです。その結果、さまざまな問題に応じて、高品質な解決策を提供できます。

強化学習テキスト
用途
強い機械学習アルゴリズムを実行し複雑な問題を解決するためのシステム
難易度
Easy
コスト
Medium
githubGitHubあり2026-07-14

memvid — Memory layer for AI Agents. Replace complex RAG pipelines with a serverless, single-file memory layer. Give your agents instant retrieval and long-term memory.

MemVidは、サーバーレスで単一ファイルの記憶層を提案し、AIエージェントが即時検索と長期的な記憶を持つようにする記憶層です。

自然言語処理大規模言語モデル生成テキスト動画
用途
AIエージェントの記憶を管理する
難易度
Easy
コスト
High
githubGitHubあり2026-07-08

VoxCPM — VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning

マルチラギングスピーチ生成やクリエイティブボイスデザイン、ルートライフクライミングなど、テクスチャファリーTTSの最新技術を実現するためのフレームワークです。

生成AI音声・音楽生成生成テキスト音声
用途
マルチラギングスピーチ生成
難易度
Easy
コスト
Medium
arxivPaper only2026-07-07

Strategic Bargaining in Multi-Buyer Markets: Reinforcement Learning from Verifiable Rewards for LLM Negotiations

複数の買い手を持つ市場における交渉システムを構築します。マーケットの規模を知り切れていない場合、セラーの損失が生じます。セラーは市場の規模を測る必要がありますが、これは複数の買い手を持つ場合に困難です。

自然言語処理大規模言語モデルテキスト強化学習
用途
複数の買い手を持つ市場における交渉
難易度
Hard
コスト
High
githubGitHubあり2026-07-07

enchanted — Enchanted is iOS and macOS app for chatting with private self hosted language models such as Llama2, Mistral or Vicuna using Ollama.

iOS、macOS用のアプリ「Enchanted」は、個人でホストした言語モデル(LLama2、Mistral、Vicunaなど)とのチャットを可能にする。

自然言語処理大規模言語モデルテキスト
用途
私家版の言語モデルとチャットするためのiOS、マックアプリ
難易度
Easy
コスト
High
arxivPaper only2026-07-06

Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

本研究では、推論プロセスの検証を目的とした Heaviside 不連続性の考慮を提案する。これにより、推論プロセスにおける潜在的なミスを検出した上で、正しい出力を生成することができる。

深層学習軽量化・量子化テキスト
用途
大容量言語モデルでの推論の検証
難易度
Hard
コスト
High
arxivPaper only2026-06-30

A Contextual-Bandit Oversight Game with Two-Sided Informational Asymmetry

AIを援助するための意思決定者によるオーバーサイトの研究。AIが提案した行動の評価と決定を行うために、意思決定者とAIが情報を交流するオーバーサイトの実現を研究する。

品質予測/異常検知強化学習マルチエージェントテキスト
用途
AIを援助するための意思決定者によるオーバーサイトの研究
難易度
Hard
コスト
Medium
githubGitHubあり2026-06-30

mxcp — Model eXecution + Context Protocol: Enterprise-Grade Data-to-AI Infrastructure

データをAIに変換する基盤を構築することで、ビジネス上の問題を解決できます。この研究では、Model eXecution + Context ProtocolであるMXCPを提案し、データの変換を簡素化した上で、AIアプ

自然言語処理大規模言語モデルテキスト
用途
データをAIに変換する基盤を構築することによって、ビジネスを改善する
難易度
Easy
コスト
High
arxivPaper only2026-06-23

Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War

大規模言語モデルの戦略1対1ベンチマークであるAge of LLMを紹介。マインスイーパーゲームを想定し、フォーゲットオブラーサー、マインスイーパー対戦、JSONスキーマへの従属性という三つのストレスアウトを設定。

自然言語処理大規模言語モデルテキスト
用途
マインスイーパーゲーム用ベンチマーク
難易度
Hard
コスト
High
arxivPaper only2026-06-16

An Optimization Framework for Automated Assessment of Biological Plausibility of Spiking Neurons

この論文では、スパイクニューロンの生物学的合理性を評価するためのオプティマイズフレームワークを提案します。このフレームワークは、Izhikevichの生物学的合理性の定義に基づいており、スパイクニューロンをモデル化するた

機械学習教師あり学習分類テキスト
用途
スパイクニューロンの生物学的合理性を評価するためのオプティマイズフレームワークの開発
難易度
Hard
コスト
Low
arxivPaper only2026-06-13

Large Language Model-Driven Cooperative Operator Ensemble Evolution for Permutation Flow Shop Scheduling

この研究では、PFSPのIterated Greedy (IG) アルゴリズムのパフォーマンスを改善するために、Large Language Model-Driven Cooperative Operator Ensem

少数データ向きCPUで試しやすい品質予測/異常検知自然言語処理大規模言語モデルテキスト
用途
PFSPのIterated Greedy (IG) アルゴリズムのパフォーマンスを改善すること。
難易度
Hard
コスト
High
arxivPaper only2026-06-12

MeEvo: Metacognitive Evolution Combined with Natural Evolution for Automatic Heuristic Design

この研究では、自動補助関数設計(AHD)についての研究を行った。AHDは、マシン学習が可能になる以前から研究されていたトピックであり、マシン学習によって、AHDがさらに活用可能になった。この研究では、AHDにおけるメタ認

品質予測/異常検知自然言語処理大規模言語モデル生成テキスト
用途
自動補助関数設計
難易度
Hard
コスト
High