text」の検索結果

593
githubGitHubあり2026-09-09

transformers — 🤗 Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.

🤗 Transformersは、テキスト・ビジョン・音声など複雑なモデル定義をサポートするフレームワークで、インフェレンスターやトレーニングに使用できる。

深層学習Transformer分類テキスト音声
用途
機械学習モデル定義
難易度
Easy
コスト
High
githubGitHubあり2026-09-09

paperless-ngx — A community-supported supercharged document management system: scan, index and archive all your documents

paperless-ngxは、コミュニティによってサポートされたスーパーチャージドのドキュメント管理システムで、ドキュメントのスキャン・インデックス・アーカイブが可能である。

自然言語処理大規模言語モデル分類テキスト
用途
ドキュメント管理
難易度
Easy
コスト
High
githubGitHubあり2026-09-09

unsloth — Local UI to run and train LLMs and diffusion models. Supports GGUF, MLX, Qwen3.8, DeepSeek-V4, MiniMax-H3, Gemma 4, FLUX and more.

Unsloth Studioは、オープンモデルのトレーニングと実行を支援するWebUIです。このライブラリは、Gemma4、Qwen3.5などのオープンモデルのテストとトレーニングを支援するために使われます。

自然言語処理大規模言語モデル生成画像テキスト
用途
オープンモデルのトレーニングと実行
難易度
Easy
コスト
High
githubGitHubあり2026-09-09

sglang — SGLang is a high-performance serving framework for large language models and multimodal models.

SGLangは、大規模言語モデルのサービングフレームワークです。このライブラリは、高性能なサービスフレームワークで、大規模言語モデルのサービングをサポートしています。

深層学習Transformer画像テキストマルチモーダル
用途
大規模言語モデルのサービングフレームワーク
難易度
Easy
コスト
High
githubGitHubあり2026-09-08

ai-agent-book — 《深入理解 AI Agent:设计原理与工程实践》(李博杰 著)开源主仓库:全书正文、编译版 PDF 与按章配套代码

この論文では、現在のVision-Language-Benchmark(VLB)を超える、MLLMがアクティブな観察を実演できるようにするためのバenchmark、ActiveVisionを提案する。このActiveVi

自然言語処理大規模言語モデルテキストマルチモーダル
用途
弁論の実際的な対象を形成するためにAIが活用される
難易度
Easy
コスト
High
githubGitHubあり2026-09-08

MOVA — A foundation model that generates synchronized video and audio in a single model

統計チャートの生成は、タブラーのデータから生成することが難しい。新しい作成フローでは、データのスクリーン、プロット提案、コード生成、レンダリング、検証による改良が含まれる。

自然言語処理ファインチューニング生成テキスト音声
用途
可視化された統計チャートの生成
難易度
Easy
コスト
High
githubGitHubあり2026-09-08

unstructured — Convert documents to structured data effortlessly. Unstructured is open-source ETL solution for transforming complex documents into clean, structured formats for language models. Visit our website to learn more about our enterprise grade Platform product for production grade workflows, partitioning, enrichments, chunking and embedding.

ドキュメントを構造化するために使えるオープンソースのETLソリューション。

表形式向き自然言語処理大規模言語モデル画像テキスト表形式
用途
ドキュメントの構造化
難易度
Easy
コスト
High
githubGitHubあり2026-09-08

presidio — An open-source framework for detecting, redacting, masking, and anonymizing sensitive data (PII) across text, images, and structured data. Supports NLP, pattern matching, and customizable pipelines.

presidioは、テキスト、画像、構造化データを含む敏感データを検出、削除、マスク、アノニマイズするオープンソースフレームワークです。自然言語処理、パターンマッチング、カスタマイズ可能なパイプラインをサポートします。

表形式向き深層学習Transformer分類検出画像
用途
データのプライバシーを保護する
難易度
Easy
コスト
Low
githubGitHubあり2026-09-02

VoxCPM — VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning

マルチラギングスピーチ生成やクリエイティブボイスデザイン、ルートライフクライミングなど、テクスチャファリーTTSの最新技術を実現するためのフレームワークです。

生成AI音声・音楽生成生成テキスト音声
用途
マルチラギングスピーチ生成
難易度
Easy
コスト
Medium
githubGitHubあり2026-08-28

Causal-Forcing — [ICML 2026] Official codebase for "Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation" & Causal Forcing++

この論文では、Causal-Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive

品質予測/異常検知深層学習軽量化・量子化生成テキスト動画
用途
高品質のビデオ生成を実現する。
難易度
Easy
コスト
High
githubGitHubあり2026-08-28

trafilatura — Python & Command-line tool to gather text and metadata on the Web: Crawling, scraping, extraction, output as CSV, JSON, HTML, MD, TXT, XML

trafilaturaはPythonとコマンドラインツールで、Webからテキストとメタデータを取得して、CSV、JSON、HTML、MD、TXT、XML形式で出力を提供します。

表形式向き自然言語処理大規模言語モデルテキスト
用途
Web上から情報を取得してテキスト抽出する
難易度
Easy
コスト
High
githubGitHubあり2026-08-26

vowpal_wabbit — Vowpal Wabbit is a machine learning system which pushes the frontier of machine learning with techniques such as online, hashing, allreduce, reductions, learning2search, active, and interactive learning.

Vowpal Wabbitは、機械学習を進歩させるためのオンライン学習、ハッシュ、reduceなどの強力なアルゴリズムを含むシステムです。その結果、さまざまな問題に応じて、高品質な解決策を提供できます。

強化学習テキスト
用途
強い機械学習アルゴリズムを実行し複雑な問題を解決するためのシステム
難易度
Easy
コスト
Medium
githubGitHubあり2026-08-21

aarambh-studio — 🦀 Decoder-only LLM built from scratch in pure Rust using Candle — no Python, no PyTorch. Gated DeltaNet + sparse attention, fine-grained MoE, native video/document understanding, long-horizon tool agents, quantization-aware training. Scales: Tiny (25M) to Large (1.3B).

Rust言語でCandleライブラリを利用して、PythonやPyTorchを使用せずにDecoder-only LLMを自作した。

深層学習軽量化・量子化テキスト動画マルチモーダル
用途
Decoder-only LLMをビルドする
難易度
Easy
コスト
High
arxivPaper only2026-08-13

Keep, Customize, or Exit: Default Design and Token Pricing in LLM Reasoning Services

この作品は、Large Language Model (LLM) サービスにおけるデフォルト設計とトークンの価格設定を行う為の機械学習手法を提案しています。この手法は、LLM サービスにおけるデフォルト設計とトークンの価

自然言語処理大規模言語モデルテキスト
用途
LLMサービスにおけるデフォルト設計とトークンの価格設定
難易度
Hard
コスト
High
arxivPaper only2026-08-11

Contextual Quality-Diversity Evolutionary Reinforcement Learning for HVAC Control in Tropical Commercial Buildings

この研究では、熱帯気候の商業ビルでの冷房システムの制御に適した、コンテキストベースの品質多様性進化的強化学習を提案します。制御システムは、データドライブの稼働状況、日々の気象と負荷のシナリオ、コンテキスト無関係の行動記述

品質予測/異常検知強化学習方策勾配 (PPO / A3C)テキスト
用途
HVACシステムの制御
難易度
Hard
コスト
Medium
arxivPaper only2026-08-11

EvoMem: Memory-Augmented Evolution for Code Optimization

成功した突然変異戦略の中には、単一の実行で利用可能な知識が存在し、その知識は複数のタスク間で移行することができる。しかし、既存のLLM-ベースの進化的フレームワークでは、再利用可能な知識は捨てられ、同じアイディアの再発見

自然言語処理大規模言語モデルQAテキスト
用途
コード最適化問題解決
難易度
Hard
コスト
High
arxivPaper only2026-08-11

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

VERDICT は、マルチモーダル論理の確認と検証をサポートするフレームワークである。このフレームワークでは、多くの場合、確認と検証は、エージェントが提供するさまざまなスコアを合計すると考えられてきたが、このフレームワー

説明可能自然言語処理大規模言語モデルテキストマルチモーダル
用途
マルチモーダル論理の確認と検証
難易度
Hard
コスト
High
githubGitHubあり2026-08-11

Static-to-Dynamic-LLMEval — The official GitHub repository of the paper "Recent advances in large language model benchmarks against data contamination: From static to dynamic evaluation"

静的評価から、動的評価に進むことができるようにする方法を提案した研究。この研究では、大規模言語モデルを用いてデータ汚染を防ぐための評価方法について検討している。

自然言語処理大規模言語モデルテキスト
用途
Large language modelの評価方法について
難易度
Easy
コスト
High
arxivPaper only2026-08-05

Dimensions of Power: A Systematic Guide to Power Indices for Explainable AI

パワーアイデントは、協力ゲーム理論の分野で生まれた概念で、各プレイヤーのゲームの結果に与える影響を測るものです。従来は利益やコストの phân配などのゲームの公平性を分析するために使用されてきたものの、最近では、AIベー

説明可能生成AIGANテキスト
用途
AIの説明を容易にする
難易度
Hard
コスト
Medium
arxivPaper only2026-08-04

Omega-S: A Functional Resilience Index for LLM Fine-Tuning

LLMが外部アクションを取り続けている場合、エージェントのメモリーが古くなったり誤った情報を持ったりする可能性があります。この問題を解決するために、この研究ではSafeCommitという技術を提案しています。SafeCo

深層学習正規化・最適化手法テキスト
用途
LLMによるメモリー・グランド・エージェントの安全なアクション
難易度
Hard
コスト
High
arxivPaper only2026-08-04

MuEvo: LLM-Driven Evolution of Multi-Heuristic Ensemble

この研究では、LLMを用いてマルチハイスティック エンサンブルを進化させる技術を提案するものです。エンサンブルの各ハイスティックは単独で効果的なものではなく、他のハイスティックと協力して最高の結果を達成するものと想定され

自然言語処理大規模言語モデルテキスト
用途
マルチハイスティック エンサンブルの進化
難易度
Hard
コスト
High
arxivPaper only2026-08-04

NeuroMosaic: Anatomically Grounded Multimodal Large Language Modeling for Molecularly Aware Glioma Reasoning from 3D MRI and Clinical Narratives

この研究では、3D MRIと臨床記録を活用した大規模言語モデルの開発を提唱。提案されたNeuroMosaicは、医療画像を解剖学的情報に基づく地域情報に変換し、臨床記録と分子情報に調整を行い、MRI領域との接続を確実にし

自然言語処理大規模言語モデル画像テキスト3D
用途
多様な医療画像と臨床記録からがんの推定を実現
難易度
Hard
コスト
High
arxivPaper only2026-07-29

EvoPINN: Agentic Discovery of Executable Algorithms for Physics-Informed Neural Networks

物理的システムの分離方程式を解くためには、ニュラルネットワークの設計、損失関数の定義、および最適化ダイナミクスの手動調整が必要である。研究者は、自動設計のためにLarge Language Models (LLMs)を利

自然言語処理大規模言語モデル生成テキスト
用途
物理的システムの分離方程式を解く
難易度
Hard
コスト
High
arxivPaper only2026-07-20

Scalable and Efficient Joint Spiking Embedding Predictive Architecture for Large-Scale Dynamic Graphs

動的グラフの構造と意味のパターンを捉えるため、最新の研究では、ラベル付けされたデータの欠如に対応するために、生成的または対比的のパラダイムを導入する。ただし、これらの方法は複雑なエッジレベルからの再構築の目標に依存し、グ

深層学習軽量化・量子化分類検出生成
用途
多階層グラフに対する埋め込み予測アーキテクチャ
難易度
Hard
コスト
High