登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 ドキュメント変換
ドキュメント変換 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
ドキュメント変換 を含む検索結果
TL;DR ローカルで完結するWindows/Linux向けデスクトップアプリで、PDFやOfficeファイルをAI向けのクリーンなMarkdownに変換します。スキャンPDF用のOCRも内蔵し、トークン消費を最大6分の1に抑えられます。 タイトル: MDFlux URL: ポイント 📄 PDF・DOCX・PPTX・XLSX・EPUB・HTML・CSV・JSON・XML・画像・音声など幅広い形式に対応 🔍 スキャンPDFも読み取れる内蔵OCR(RapidOCR)を搭載 📦 フォルダ単位の一括変換に対応し、並行処理で高速化 🔒 初回セットアップ後は完全オフライン動作、既定でクラウド送信なし 🧹 クリーンアップはオフ・ルールベース・AI(ローカル/API)から選択可能 ⚡ ビジョンモデル利用時と比べトークン数を2〜6倍削減(スキャンページは5.7倍) 🛠 Tauri 2(Rust)+ Svelte 5構成、Microsoft製MarkItDownをベースに構築 社内文書をRAGパイプラインに流す前処理として、プライバシーを保ったまま使えるのが良いところだと感じます。 #ドキュメント変換# #OCR#
もっと見る
🏛 要件仕様書を入れると、4+1ビューのアーキテクチャ図から本番品質のドキュメント、ATAM相当の評価レポートまで自動生成。4つの専門エージェントが要件と設計の橋渡しをします。 タイトル: Bridging Requirements and Architecture: Multi-Agent Orchestration with External Knowledge and Hierarchical Memory URL: 📝 概要 MAADは、ソフトウェア要件仕様(SRS)からアーキテクチャ設計までを、役割特化の4エージェントでオーケストレーションするフレームワークです。外部知識(RAG)と3層の階層メモリで、一貫性とトレーサビリティを担保します。 ❓ 解決する課題 アーキテクチャ設計は複雑で知識集約的なため、アーキテクトに大きく依存していました。単一LLMは出力が一貫せず要件カバレッジが不完全で、既存のマルチエージェントもアーキ固有のワークフローや知識統合を欠いていました。 💡 方法論と提案手法 ・Analystが要件(FR/NFR/ASR)を抽出し、Modelerが4+1ビューのUML図へ、Designerが本番品質ドキュメントへ変換します ・EvaluatorがトレーサビリティとATAMベースの分析で各段に品質ゲートを設けます ・ISO/IEC/IEEE 42010などの標準や定番書籍をベクトルDBに埋め込み、クエリごとに上位3件を参照します ・作業記憶・エピソード記憶・意味記憶の3層メモリで、反復的な洗練と知識再利用を支えます 🎯 ユースケース 要件からの素早いアーキテクチャ設計、要件変更に追従する一貫性維持、暗黙知に頼らない知識移転、自動検証によるレビュー負荷削減などに使えます。 📊 実験結果 ・実世界のSRS 10件で、MetaGPTより完全・モジュール性が高く・トレーサブルなアーキテクチャを生成 ・結合度や凝集度など7つのアーキテクチャ指標で評価し、Evaluatorが品質レポートを自動生成 ・評価LLMではGPT-5.2とQwen3.5が多くの設定で他を上回りました ・現役アーキテクト6名が「原則に整合し実開発に適する」と評価しました #SoftwareArchitecture# #AIエージェント#
もっと見る
# Elasticsearchの機能と実践的な使い方 🔎 「検索→変換→集計」を1本のパイプで書ける。SQLライクで学習コストが低い新世代のクエリ言語、それがES|QLです。 🏷️ タイトル: ES|QL(パイプ型クエリ言語) 🔗 URL: 📘 概要 ES|QLはElasticsearchのデータを問い合わせ・集計・可視化・アラート化まで一気通貫で扱える新しいクエリ言語です。Unixのパイプのように `|` でコマンドを連結し、データを段階的に絞り込み・変換・集約していきます。JSONの集計DSLを書かずに、アドホック分析を素早く進められます。 ⚙️ 機能の説明 クエリは必ずソースコマンドから始まり、処理コマンドをパイプで連結する構造です。 ・`FROM` でインデックス/データストリームを指定(時系列向けの `TS` もある) ・`WHERE` で行を絞り込み ・`STATS ... BY` で集計とグルーピング ・`EVAL` で派生列を生成、`SORT` で並べ替え、`LIMIT` で件数制限 ・`KEEP`/`DROP`/`RENAME` で出力列を制御 ・`DISSECT`/`GROK` で非構造テキストをパース ・`LOOKUP JOIN` でマスタデータと結合、`ENRICH` でポリシー付与 コマンドや関数名は大文字小文字を区別しません(`FROM` も `from` も同じ)。 🛠️ 実践的な使い方 障害調査では、検索から集計までを次のように1本で書けます。 `FROM logs-* | WHERE status >= 500 | STATS count = COUNT(*) BY BUCKET(@timestamp, 5m) | SORT count DESC` Kibanaのエディタはオートコンプリート、インライン補完、Prettifyボタンによる自動整形を備え、実行後はフッターに処理ドキュメント数などの統計が出ます。同じES|QLがDiscover・ダッシュボードのパネル・アラートルール・Elastic Securityで共通に使えるのが大きな利点です。クエリ履歴やお気に入り(スター)機能で定番クエリの再利用も可能です。 💡 ユースケース ・SREのアドホックなログ分析(エラー率のサービス別・時間バケット別集計) ・ダッシュボードのES|QL可視化パネル ・セキュリティの検知ルールやアラート条件の記述 ・`LOOKUP JOIN` でサービス名→チーム名のようなマスタ結合を行う運用分析 ⚠️ 注意点 ・フィルタなしで多数のインデックスを横断するとレスポンスが肥大化するため、`KEEP`/`DROP` で列を絞ること。 ・Kibana内では `SET time_zone` ではなく `dateFormat:tz` 設定でタイムゾーンを扱う。 ・自然言語からのクエリ生成はEnterpriseライセンスとコネクタ設定が必要です。 ・マッピングされていないフィールド参照は既定で失敗するため注意が必要です。 #Elasticsearch# #ESQL#
もっと見る
エンタープライズRAGの「文書チャンキング」問題を、コスト95.7%削減しながら解いた手法が発表されました。 タイトル: D-RAC: Document Retrieval-Aware Chunking URL: 📌 概要 PDF・DOCX・PPTX・スキャン画像などバラバラな企業文書を、いったんPDFに正規化してからマルチモーダルLLMで検索最適化Markdownに1回だけ変換し、そのあとはID単位で決定的にチャンク計画を立てる4段階パイプラインです。 ❗ 解決する課題 従来のルールベース抽出は表や見出し階層を壊してしまい、精度重視のエージェント的チャンキングは文書全体を再生成するためコストが高くつくというジレンマがありました。 🛠️ 方法論・提案手法 表を列見出し付きの1文にする「行レベル散文化」、見出し階層の再構成、ID配列だけを渡すチャンク計画など、検索精度とコスト効率を両立する設計を随所に採用しています。 📊 実験結果 236文書・795ページの評価で、出力トークンを95.7%削減しつつRecall@6は0.798とエージェント的手法(0.795)やルールベース(0.717)を上回りました。処理時間も75%短縮しています。 🏢 ユースケース 自動車・銀行・クラウドなど複数業界の文書で安定した性能を確認しており、本番のエンタープライズRAGパイプラインへそのまま組み込みやすい設計です。 #RAG# #ドキュメント処理#
もっと見る
# Palantir Foundryを学ぶ 🚀 ノーコードでは届かない複雑なロジックを、ソフトウェア工学の品質管理ごとデータ基盤に持ち込む。それがCode Repositoriesです。 📌 タイトルと機能のURL タイトル: Code Repositories(Pythonトランスフォーム) URL: 📝 概要 Code Repositoriesは、Foundry内で本番品質のコードを作成・協働するためのWebベースの統合開発環境(IDE)です。基盤にあるGitリポジトリをブラウザのUIから操作でき、コマンドライン無しでチーム開発を進められます。プラットフォーム固有の機能を備え、データエンジニアリングにソフトウェア開発の作法をそのまま適用できます。 🔧 機能の説明 バージョン管理とコラボレーションが中核です。 ・ブランチ作成・コミット・リリースタグ付けといったGit操作をWeb UIから実行できます ・プルリクエスト(PR)でコードレビューを行い、権限は「高度に設定可能」でレビュー必須化などの品質保証を支えます ・IntelliSense、リンティング、エラーチェック、文脈に応じたヘルプダイアログがすべてのリポジトリ種別で利用できます ・Transformsリポジトリでは、Python・Java・SQLでのデータ変換ロジックを記述し、プレビューとデバッグが可能です ・FunctionsリポジトリはオントロジーをネイティブにサポートしTypeScript/Pythonで低レイテンシのビジネスロジックを実装できます 🛠 実践的な使い方 ・PySparkを用いて、数十億行規模の名寄せや複雑な業務ルールをコードで実装します ・PRレビューを必須に設定し、マージ前に第三者の確認とCIチェックを通すことを強制します ・ユニットテストを組み込み、変換ロジックの回帰を防ぎます ・Functionsリポジトリでは、オントロジーのデータ型に基づくオートコンプリートを活かして安全にロジックを記述します ・モデル開発リポジトリで機械学習ワークフローもプラットフォーム内に取り込みます 🎯 ユースケース ・Pipeline Builderでは表現しきれない複雑な名寄せ・業務ルールをPySparkで実装 ・「本番直編集によるデグレ」を、レビュー必須化とブランチ運用で構造的に排除 ・派生KPIや検証ロジックをFunctionsとして実装し、各アプリから再利用 ・MLモデルの学習・推論コードをガバナンス下で管理 ⚠️ 注意点 ・ドキュメントの日本語訳は機械生成で未検証である旨が記載されており、ローカライズ内容には精度上の限界がある可能性があります ・リポジトリ種別(Transforms/Functions/Model)ごとに対応言語や用途が異なるため、目的に合った種別を選ぶ必要があります ・プロコード環境ゆえ、レビュー・CI・テストの運用ルールを組織として整備しないと品質管理の効果が出ません #PalantirFoundry# #DataEngineering#
もっと見る
便利だけど知られていないClaude APIの機能 🌊 ツール呼び出しの引数が大きいとき、全部揃うまで待っていませんか? ClaudeのFine-Grained Tool Streaming(細粒度ツールストリーミング)は、ツール呼び出しの引数を細かい粒度でストリーミング受信できる機能です。大きな引数の早期処理やUIへのリアルタイム反映に効きます。 📌 タイトル:Fine-Grained Tool Streaming(細粒度ツールストリーミング) 🔗 URL: 🧩 概要 通常のツール呼び出しでは、引数のJSON全体が完成してからツールを実行します。しかし、引数が大きい場合(長いコードや文章など)、完成を待つ時間がもったいない。Fine-Grained Tool Streamingは、ツール引数が生成される途中の部分的なデータをストリーミングイベントとして受信できる機能です。UIにリアルタイムで反映したり、前処理を並行で始めたりできます。 🛠 使い方 ストリーミングモードでMessages APIを呼び出すと、ツール呼び出しの引数がinput_json_deltaイベントとして段階的に送られてきます。これを受信しながらUIに表示したり、引数の一部が確定した時点で前処理を開始したりできます。完全なJSONが揃った段階でツールを実行するフローはそのままに、ユーザーには進捗を見せられます。 🏗 本番システムへの組み込み方 ・コーディングUI:生成中のコードをリアルタイムでエディタに表示。ユーザーはコードが書かれていく過程を見ながら待てます。 ・ドキュメント生成:長い文章をツール引数として生成するとき、書かれていく内容を逐次プレビュー表示。 ・データ変換パイプライン:大きなJSON引数の一部が確定した段階でバリデーションやスキーマチェックを先行実行。 ・プログレスUI:ツール引数のストリーミング進捗を表示することで、「何をしようとしているか」をユーザーに可視化。 💡 ユースケース ⌨️ コード生成のリアルタイムプレビュー 📝 文書生成の逐次表示 ✅ 引数の先行バリデーション 📊 ツール呼び出しのプログレス表示 ⚠️ 注意点 ストリーミング中のデータは不完全なJSONなので、途中でパースしようとするとエラーになります。部分データはあくまで「プレビュー/先行処理」用とし、ツールの実行自体は完全なJSONが揃ってから行ってください。ストリーミングイベントのハンドリングコードはやや複雑になるので、既存のSDKのヘルパーを活用するのがおすすめです。 ✨ 「待ち時間にユーザーに何も見せない」はUXの大きな機会損失。ツール引数のストリーミングで、レスポンシブなインターフェースを実現しましょう。 #Claude# #LLM#
もっと見る
ドキュメント72時間:あすは“選” 東京郊外、24時間営業の中華料理店 早朝から深夜までひっきりなしに客 “人生”を見つめる #ドキュメント72時間# #72hours# @nhk_72HR
もっと見る
ドキュメント72時間:舞台は沖縄・コザの“24時間営業”のスナック 時間を忘れて酒を飲み、歌い、踊り、そして眠る人…その“胸の内”は? #ドキュメント72時間# #72hours# @nhk_72HR
もっと見る
ドキュメント72時間:「全国うどん自販機の旅 群馬編」アンコール 県内に8カ所も 古びた自販機の何が人を引きつけるのか #ドキュメント72時間# #72hours# #うどん自販機# @nhk_72HR
もっと見る
『ドキュメント72時間』“うどん自販機”最新作「瀬戸内編」9・4放送 麒麟・川島明がアフタートーク 過去作3本も再放送 🔻記事&写真はこちら #ドキュメント72時間# #うどん自販機#
もっと見る